Last run: August 13, 2026
DataBench
A frontier benchmark for complex data work and analytical reasoning
DataBench score
Pareto frontier is the best possible score for a given metric. It is the line that connects the highest scores for each metric.
| Model | Average cost per task | DataBench score |
|---|---|---|
| Fable 5 Max | $4.7 | 85% |
| Fable 5 High | $2.6 | 71% |
| Fable 5 Medium | $2.1 | 76% |
| Fable 5 Low | $1.5 | 72% |
| Opus 5 Max | $3.1 | 70% |
| Opus 5 XHigh | $2.8 | 80% |
| Opus 5 High | $2.1 | 88% |
| Opus 5 Medium | $1.4 | 83% |
| Opus 5 Low | $1.0 | 70% |
| GPT-5.6 Sol XHigh | $1.2 | 75% |
| GPT-5.6 Sol High | $0.9 | 72% |
| GPT-5.6 Sol Medium | $0.7 | 71% |
| GPT-5.6 Sol Low | $0.5 | 65% |
| Opus 4.8 Max | $2.8 | 74% |
| Opus 4.8 XHigh | $1.8 | 70% |
| Opus 4.8 High | $1.4 | 70% |
| Opus 4.8 Medium | $1.1 | 70% |
| Opus 4.8 Low | $0.8 | 72% |
| GPT-5.6 Luna XHigh | $0.1 | 73% |
| GPT-5.6 Luna High | $0.1 | 64% |
| GPT-5.6 Luna Medium | $0.0 | 64% |
| GPT-5.6 Luna Low | $0.1 | 50% |
| GPT-5.6 Terra XHigh | $0.4 | 68% |
| GPT-5.6 Terra High | $0.3 | 63% |
| GPT-5.6 Terra Medium | $0.3 | 57% |
| GPT-5.6 Terra Low | $0.2 | 70% |
| Sonnet 5 Max | $1.4 | 61% |
| Sonnet 5 XHigh | $0.9 | 64% |
| Sonnet 5 High | $0.7 | 60% |
| Sonnet 5 Medium | $0.5 | 56% |
| Sonnet 5 Low | $0.4 | 55% |
| Kimi K2.7 Medium | $0.3 | 53% |
Average cost per task
Example tasks
Each is evaluated against a rubric measuring analytical reasoning, tool use, evidence quality, and the final recommendation.
| 1Opus 5 · High | 88.0% | $2.13 | 42K | 482.4s |
|---|---|---|---|---|
| 2Fable 5 · Max | 85.0% | $4.73 | 55.3K | 406.2s |
| 3Opus 5 · Medium | 83.0% | $1.37 | 25.9K | 190.9s |
| 4Opus 5 · XHigh | 80.0% | $2.77 | 59.3K | 450.5s |
| 5Fable 5 · Medium | 76.0% | $2.10 | 17.9K | 182.9s |
| 6GPT-5.6 Sol · XHigh | 75.0% | $1.22 | 19.5K | 429.5s |
| 7Opus 4.8 · Max | 74.0% | $2.82 | 75.7K | 489.8s |
| 8GPT-5.6 Luna · XHigh | 73.0% | $0.09 | 16.5K | 193.3s |
| 9GPT-5.6 Sol · High | 72.0% | $0.92 | 14.7K | 275s |
| 10Opus 4.8 · Low | 72.0% | $0.84 | 15K | 131.4s |
| 11Fable 5 · Low | 72.0% | $1.48 | 11.5K | 111s |
| 12Fable 5 · High | 71.0% | $2.55 | 24.4K | 188.3s |
| 13GPT-5.6 Sol · Medium | 71.0% | $0.71 | 11.1K | 149.9s |
| 14Opus 4.8 · XHigh | 70.0% | $1.78 | 43.7K | 353s |
| 15Opus 5 · Max | 70.0% | $3.06 | 67.6K | 484.1s |
| 16Opus 5 · Low | 70.0% | $0.97 | 17.5K | 160.9s |
| 17Opus 4.8 · High | 70.0% | $1.38 | 28.4K | 465.1s |
| 18Opus 4.8 · Medium | 70.0% | $1.11 | 23K | 188.5s |
| 19GPT-5.6 Terra · Low | 70.0% | $0.20 | 6.8K | 102.3s |
| 20GPT-5.6 Terra · XHigh | 68.0% | $0.40 | 15.6K | 350.5s |
| 21GPT-5.6 Sol · Low | 65.0% | $0.46 | 7.9K | 123.6s |
| 22GPT-5.6 Luna · High | 64.0% | $0.07 | 13.4K | 187.3s |
| 23GPT-5.6 Luna · Medium | 64.0% | $0.05 | 7.3K | 143.4s |
| 24Sonnet 5 · XHigh | 64.0% | $0.87 | 43.5K | 370.3s |
| 25GPT-5.6 Terra · High | 63.0% | $0.28 | 10.4K | 120.8s |
| 26Sonnet 5 · Max | 61.0% | $1.40 | 83.6K | 453.2s |
| 27Sonnet 5 · High | 60.0% | $0.67 | 30.7K | 213.9s |
| 28GPT-5.6 Terra · Medium | 57.0% | $0.25 | 8.3K | 638.6s |
| 29Sonnet 5 · Medium | 56.0% | $0.54 | 20.6K | 462.2s |
| 30Sonnet 5 · Low | 55.0% | $0.35 | 13K | 199.3s |
| 31Kimi K2.7 · Medium | 53.0% | $0.29 | 10.4K | 83.2s |
| 32GPT-5.6 Luna · Low | 50.0% | $0.06 | 5.9K | 352.5s |