OpenAI's current flagship. Leads ARC-AGI-2 at 85%. Strong on coding and reasoning.
Each score is anchored to human baseline (100). Source URLs link to the original benchmark, leaderboard, or release note.
| Sub-capability | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Abstract Reasoning | independent | arcprize.org/leaderboard | 85% | |
| Logical Reasoning | vendor reported | openai.com/index/introducing-gpt-5-5 | 76% |
| Sub-capability | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Language Generation | independent | lmarena.ai | 104% |
| Sub-capability | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Open-ended Problem Solving | vendor reported | openai.com/index/introducing-gpt-5-5 | 52% |