AGIdex
agidex/Capabilities/Reasoning/Abstract Reasoning
SUB-CAPABILITY · REASONING

Abstract Reasoning

58%
vs. HUMAN BASELINE = 100
PartialConf · Medium

Scoring rubric

0–20
Early research
20–40
Narrow benchmark competence
40–60
Strong benchmark · reliability gaps
60–80
Human-competitive in common scenarios
80–100
Comparable to typical skilled adult
100+
Reliably exceeds typical human baseline

Score vs. baseline

Trend · Last 12 months
12mo ago   %
6mo ago   %
Today   %
Δ 12mo   +0

What this measures

Human baseline

Solve novel pattern problems by extracting a rule from a few examples.

Human frontier

Solve unseen ARC-AGI tasks efficiently without task-specific training.

Current state

What works

Frontier models reach 85% on ARC-AGI-2 at high compute cost.

Key gaps

ARC-AGI-3 reset frontier models to near-zero — efficient novel generalization unsolved.

Evidence

4 sources
TechnologyQualitySourceScore vs. baselineScore
Claude Opus 4.7independentarcprize.org/leaderboard
69%
GPT-5.5independentarcprize.org/leaderboard
85%
GPT-5.4independentarcprize.org/leaderboard
73%
Gemini 3.1 Proindependentarcprize.org/leaderboard
77%
Source: arcprize.org/leaderboard · Last reviewed May 2026