Google DeepMind's current flagship. 1M token context. 77.1% on ARC-AGI-2, 94.3% GPQA Diamond.
Each score is anchored to human baseline (100). Source URLs link to the original benchmark, leaderboard, or release note.
| Sub-capability | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Abstract Reasoning | independent | arcprize.org/leaderboard | 77% | |
| Logical Reasoning | vendor reported | deepmind.google/models/model-cards/gemini-3-1-pro | 71% |
| Sub-capability | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Multilingual | vendor reported | deepmind.google/models/model-cards/gemini-3-1-pro | 110% |
| Sub-capability | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Visual Reasoning | vendor reported | deepmind.google/models/model-cards/gemini-3-1-pro | 80% |