Balanced mid-tier. Preferred by developers for everyday tasks. 1M token context.
Each score is anchored to human baseline (100). Source URLs link to the original benchmark, leaderboard, or release note.
| Sub-capability | Quality | Source | Score vs. baseline | Score |
|---|---|---|---|---|
| Language Generation | independent | lmarena.ai | 98% | |
| Language Understanding | vendor reported | anthropic.com/claude/sonnet-4-6 | 94% |