Answer straightforward questions about image content — count, color, position.
Multi-step spatial and diagrammatic reasoning across disciplines without domain training.
VQA on natural images; chart and figure understanding in academic papers.
3D spatial reasoning; novel diagram types not seen during training.
| Technology | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Claude Opus 4.7 | independent | vellum.ai/blog/claude-opus-4-7-benchmarks-explained | 84% | |
| Gemini 3.1 Pro | vendor reported | deepmind.google/models/model-cards/gemini-3-1-pro | 80% |