Skip to main content

Last updated: September 22, 2026

DataBench

A frontier benchmark for complex data work and analytical reasoning

arrow-right-mediumLearn more about DataBench

DataBench score

Pareto frontier is the best possible score for a given metric. It is the line that connects the highest scores for each metric.
DataBench score by average cost per task
ModelAverage cost per taskDataBench score
GPT-5.6 Luna XHigh$0.0435.3%
GPT-5.6 Luna High$0.0331.3%
GPT-5.6 Luna Medium$0.0224%
GPT-5.6 Luna Low$0.0119%
GPT-5.6 Terra XHigh$0.3039.3%
GPT-5.6 Terra High$0.2032.7%
GPT-5.6 Terra Medium$0.1529.3%
GPT-5.6 Terra Low$0.1427%
GPT-5.6 Sol XHigh$0.9840.3%
GPT-5.6 Sol High$0.7538%
GPT-5.6 Sol Medium$0.6139.7%
GPT-5.6 Sol Low$0.3729.7%
GPT-6 Astra Max$2.1155%
GPT-6 Astra XHigh$1.7552.3%
GPT-6 Astra High$1.6252%
GPT-6 Astra Medium$1.2452.7%
GPT-6 Astra Low$0.8555%
Sonnet 5 Max$1.0712.3%
Sonnet 5 XHigh$0.6214.3%
Sonnet 5 High$0.4913.7%
Sonnet 5 Medium$0.3613.3%
Sonnet 5 Low$0.2611.7%
Opus 4.8 Max$1.7815%
Opus 4.8 XHigh$1.2018.7%
Opus 4.8 High$0.8614%
Opus 4.8 Medium$0.7617%
Opus 4.8 Low$0.6012%
Opus 5 Max$2.1119.7%
Opus 5 XHigh$1.8917.3%
Opus 5 High$1.6118%
Opus 5 Medium$1.1017%
Opus 5 Low$0.7415.7%
Fable 5 Max$3.4918%
Fable 5 High$1.8816%
Fable 5 Medium$1.5014.7%
Fable 5 Low$1.1415%
Fable 5.1 Max$3.3627%
Fable 5.1 XHigh$2.5021.7%
Fable 5.1 High$1.5720.3%
Fable 5.1 Medium$1.1821%
Fable 5.1 Low$0.9216.3%
GLM 5.3 Max$0.6416.3%
GLM 5.3 High$0.3614.7%
GLM 5.3 Low$0.208.7%
GLM 5.2 Max$0.329%
GLM 5.2 High$0.2513.3%
DeepSeek V4.1 Flash High$0.1414%
DeepSeek V4.1 Flash Low$0.1013.7%
Kimi K2.7 Medium$0.2812.7%
Opus 5.5 Max$3.5770.5%
Opus 5.5 XHigh$2.1667%
Opus 5.5 High$1.2565%
Opus 5.5 Medium$0.9762.5%
Opus 5.5 Low$0.6154%
GPT-6 Luna Max$0.0652.3%
GPT-6 Luna XHigh$0.0446%
GPT-6 Luna High$0.0346%
GPT-6 Luna Medium$0.0242.7%
GPT-6 Luna Low$0.0130.3%
GPT-6 Sol Max$0.9857%
GPT-6 Sol XHigh$0.5861.3%
GPT-6 Sol High$0.3954.7%
GPT-6 Sol Medium$0.2751.3%
GPT-6 Sol Low$0.1750.3%

Average cost per task

OpenAI
Anthropic
Z.ai
DeepSeek
Moonshot
  • Low Effort
  • Medium Effort
  • High Effort
  • XHigh Effort
  • Max Effort

Example tasks

Each is evaluated against a rubric measuring analytical reasoning, tool use, evidence quality, and the final recommendation.

1Opus 5.5 · Max70.5%$3.57115.1K677.2s
2Opus 5.5 · XHigh67.0%$2.1662.8K387.6s
3Opus 5.5 · High65.0%$1.2530.5K220.1s
4Opus 5.5 · Medium62.5%$0.9722.5K169.6s
5GPT-6 Sol · XHigh61.3%$0.5814.6K326.7s
6GPT-6 Sol · Max57.0%$0.9829.9K617.5s
7GPT-6 Astra · Low55.0%$0.852.7K88.5s
8GPT-6 Astra · Max55.0%$2.1114.8K313.9s
9GPT-6 Sol · High54.7%$0.398.5K238s
10Opus 5.5 · Low54.0%$0.6113K110.8s
11GPT-6 Astra · Medium52.7%$1.244.9K128.3s
12GPT-6 Astra · XHigh52.3%$1.759.3K224.3s
13GPT-6 Luna · Max52.3%$0.0637.9K353.2s
14GPT-6 Astra · High52.0%$1.627.7K186.5s
15GPT-6 Sol · Medium51.3%$0.274.8K146.2s
16GPT-6 Sol · Low50.3%$0.172.8K97.6s
17GPT-6 Luna · High46.0%$0.0315.5K175.4s
18GPT-6 Luna · XHigh46.0%$0.0419.3K188.7s
19GPT-6 Luna · Medium42.7%$0.029.1K116.6s
20GPT-5.6 Sol · XHigh40.3%$0.9811.4K210.2s
21GPT-5.6 Sol · Medium39.7%$0.615.6K134.3s
22GPT-5.6 Terra · XHigh39.3%$0.309.5K123.9s
23GPT-5.6 Sol · High38.0%$0.758K173.3s
24GPT-5.6 Luna · XHigh35.3%$0.0411K145.3s
25GPT-5.6 Terra · High32.7%$0.205.4K95.2s
26GPT-5.6 Luna · High31.3%$0.037.9K118.1s
27GPT-6 Luna · Low30.3%$0.012.6K63.5s
28GPT-5.6 Sol · Low29.7%$0.372.8K76.2s
29GPT-5.6 Terra · Medium29.3%$0.153.2K69.4s
30GPT-5.6 Terra · Low27.0%$0.142.8K64.5s
31Fable 5.1 · Max27.0%$3.3631.3K419s
32GPT-5.6 Luna · Medium24.0%$0.023.8K78.8s
33Fable 5.1 · XHigh21.7%$2.5021.1K296.7s
34Fable 5.1 · Medium21.0%$1.188.1K126.3s
35Fable 5.1 · High20.3%$1.5711.4K192.6s
36Opus 5 · Max19.7%$2.1129.1K392.7s
37GPT-5.6 Luna · Low19.0%$0.012.3K61.3s
38Opus 4.8 · XHigh18.7%$1.2020K251s
39Opus 5 · High18.0%$1.6118.9K246.5s
40Fable 5 · Max18.0%$3.4927.5K380s
41Opus 5 · XHigh17.3%$1.8924.2K337.5s
42Opus 4.8 · Medium17.0%$0.7610.1K133.4s
43Opus 5 · Medium17.0%$1.1011.4K149.5s
44Fable 5.1 · Low16.3%$0.926.1K101.7s
45GLM 5.3 · Max16.3%$0.6438.8K518.5s
46Fable 5 · High16.0%$1.8810.2K156.7s
47Opus 5 · Low15.7%$0.746.9K98.2s
48Opus 4.8 · Max15.0%$1.7834.7K433.9s
49Fable 5 · Low15.0%$1.144.7K79.8s
50Fable 5 · Medium14.7%$1.507.2K125s
51GLM 5.3 · High14.7%$0.3614.9K215.1s
52Sonnet 5 · XHigh14.3%$0.6220.2K213.6s
53Opus 4.8 · High14.0%$0.8612.2K186.7s
54DeepSeek V4.1 Flash · High14.0%$0.1431.7K168.4s
55Sonnet 5 · High13.7%$0.4914.3K170.4s
56DeepSeek V4.1 Flash · Low13.7%$0.1023.3K117.7s
57Sonnet 5 · Medium13.3%$0.369.1K114s
58GLM 5.2 · High13.3%$0.2510.5K136.7s
59Kimi K2.7 · Medium12.7%$0.2811.8K156.4s
60Sonnet 5 · Max12.3%$1.0743.1K450.9s
61Opus 4.8 · Low12.0%$0.606.9K96.2s
62Sonnet 5 · Low11.7%$0.265.9K75.4s
63GLM 5.2 · Max9.0%$0.3219.1K184s
64GLM 5.3 · Low8.7%$0.205.3K94.7s

Changelog

v1.1: Judge calibration improvements

Updated judges and rubrics to fix accidental rewarding of misleading responses. This makes the benchmark significantly more difficult overall, with Anthropic models especially impacted.