HOW TO READ THIS
Score is only one signal.
Consensus score estimates relative capability across public evaluations. Coverage tells you how much evidence sits behind the placement, while confidence describes evidence quality rather than intelligence.
Model evaluation profile · Source snapshot checked Aug 21, 2026
SOURCE SCORECARD
Original benchmark rank, score, and model identifiers stay visible for auditability. Missing evaluations remain visible instead of being treated as zeroes.
| Evaluation | Source rank | Raw score | Source model ID | |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | #2 | 62.1 | claude-fable-5 | Official board ↗ |
| Artificial Analysis Multilingual Index | — | Not evaluated | — | Official board ↗ |
| DeepSWE v1.1 | #3 | 0.7 | claude-fable-5 | Official board ↗ |
| LiveBench Global Average | #1 | 83.0 | claude-fable-5-max-effort | Official board ↗ |
| Arena Text Style-Controlled | #1 | 1,508 | claude-fable-5 | Official board ↗ |
| Arena WebDev | #6 | 1,626 | claude-fable-5 | Official board ↗ |
| APEX-Agents Mean Score · ReAct | #1 | 60.9 | claude-fable-5 | Official board ↗ |
| APEX-Agents Mean Score · Loop | #2 | 59.2 | claude-fable-5 | Official board ↗ |
| TapTap Maker Benchmark | #1 | 0.9 | claude-fable-5 | Official board ↗ |
| Vals Finance Agent | #6 | 56.3 | anthropic/claude-fable-5 | Official board ↗ |
Showing the latest verified benchmark snapshot.
HOW TO READ THIS
Consensus score estimates relative capability across public evaluations. Coverage tells you how much evidence sits behind the placement, while confidence describes evidence quality rather than intelligence.
MODEL SNAPSHOT
Benchmark results link directly to the original evaluation providers listed above.