Previous OpenAI flagship. Strong cost-quality balance for production workloads.
Each score is anchored to human baseline (100). Source URLs link to the original benchmark, leaderboard, or release note.
| Sub-capability | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Abstract Reasoning | independent | arcprize.org/leaderboard | 73% | |
| Logical Reasoning | vendor reported | openai.com/research/gpt-5-4 | 72% | |
| Multi-step Planning | independent | paperswithcode.com/sota/autonomous-agents-on-gaia | 56% |