Explore real published runs. Compare outcomes, inspect failures, and trace the gap back to the work.
Published benchmark runs · τ2-bench · recorded cost and performance
400 runs. 50 tasks. Every outcome visible.GPT-5.2 · high and Claude Opus 4.5 · high · source-reported rewards
Same task specs, trial keys, recorded seeds and shared recorded configuration. Historical runtime dependencies were not independently reproduced.
GPT-5.2 · high
83.0%recorded pass · 166 / 200 runs
Claude Opus 4.5 · high
84.0%recorded pass · 168 / 200 runs
Task-level disagreement
14 / 50tasks with different observed pass rates
Variable across trials
17 / 50tasks where at least one model both passes and fails
01 · Outcome comparison
How often did it work?
Source rewards
GPT-5.2 · high166 pass · 34 fail · 0 unknown
83.0%
Claude Opus 4.5 · high168 pass · 32 fail · 0 unknown
84.0%
0%25%50%75%100%
Pass = upstream reward 1. All selected runs stay in the denominator. Published runs are not a current frontier ranking or a forecast of your workflow.
02 · Matched outcomes
Where do they disagree?
200 pairs
155Both pass
11Only GPT-5.2 · high passes
13Only Claude Opus 4.5 · high passes
21Both fail
Shared task/trial keys only, even in the full-file view. 0 pairs have unknown outcomes. Disagreement identifies a next test; it is not causal attribution.
Measured trade-offs · source records
What does each successful outcome cost?
Mean recorded agent cost versus pass rate. Every selected run, including failures, contributes to spend.
Recorded model-priced costs
Lower cost and higher pass rate describe a trade-off within this source cohort. The chart does not establish statistical significance or invoice-verified billing.
Selected model
GPT-5.2 · high
Recorded mean agent cost
$0.1138
Observed spend / recorded pass
$0.1371
Recorded pass rate
83.0% · 166/200
Cost coverage
200/200 runs
Simulation duration · median / p95
870.9s / 1,443.1s
Duration includes the simulated user and tool work, not just agent inference. Cost excludes the user simulator. Observed spend per pass includes spending on failed runs; it is not a forecast.
Exact cost and outcome comparison
Model
Passed / selected
Mean agent cost
Spend / pass
Median / p95 simulation duration
166/200
$0.1138 · 200/200
$0.1371
870.9s / 1,443.1s · 200/200
168/200
$0.3992 · 200/200
$0.4752
128.5s / 240.4s · 200/200
03 · Task-level resolution
Averages hide the tasks that break.
Each column is one task. Select a cell to inspect its runs below.
Gap · pp+75-50+50+25-25-25-25+25-25+25+25-25-25+25000000000000000000000000000000000000
Task pass-rate distribution
Task difficulty profiles
One task, one band per model. See where reliable passes remain rare in these recorded trials.
0–25%>25–40%>40–60%>60%
GPT-5.2 · high50/50 tasks classified
Claude Opus 4.5 · high50/50 tasks classified
Point to or focus a band to inspect its task count. Select it to see the exact tasks.GPT-5.2 · high: 7 of 50 tasks in 0–25%. At most one in four retained trials passed.GPT-5.2 · high: 0 of 50 tasks in >25–40%. More than 25%, at most 40% of retained trials passed.GPT-5.2 · high: 1 of 50 tasks in >40–60%. More than 40%, at most 60% of retained trials passed.GPT-5.2 · high: 42 of 50 tasks in >60%. More than 60% of retained trials passed.GPT-5.2 · high: 0 of 50 tasks in Incomplete outcomes. At least one unknown outcome, or no run for this model and task.Claude Opus 4.5 · high: 6 of 50 tasks in 0–25%. At most one in four retained trials passed.Claude Opus 4.5 · high: 0 of 50 tasks in >25–40%. More than 25%, at most 40% of retained trials passed.Claude Opus 4.5 · high: 2 of 50 tasks in >40–60%. More than 40%, at most 60% of retained trials passed.Claude Opus 4.5 · high: 42 of 50 tasks in >60%. More than 60% of retained trials passed.Claude Opus 4.5 · high: 0 of 50 tasks in Incomplete outcomes. At least one unknown outcome, or no run for this model and task.
Bands use each model’s pass count divided by all retained trials for a task. Unknown outcomes or missing model/task runs stay unclassified. This describes observed results, not intrinsic task difficulty.
Exact difficulty counts and task shares
Common population: 50 tasks per model
Model / band
Tasks
Share of tasks
GPT-5.2 · high0–25%
7 / 50
7/50 (14.0%)
GPT-5.2 · high>25–40%
0 / 50
0/50 (0.0%)
GPT-5.2 · high>40–60%
1 / 50
1/50 (2.0%)
GPT-5.2 · high>60%
42 / 50
42/50 (84.0%)
GPT-5.2 · highIncomplete outcomes
0 / 50
0/50 (0.0%)
Claude Opus 4.5 · high0–25%
6 / 50
6/50 (12.0%)
Claude Opus 4.5 · high>25–40%
0 / 50
0/50 (0.0%)
Claude Opus 4.5 · high>40–60%
2 / 50
2/50 (4.0%)
Claude Opus 4.5 · high>60%
42 / 50
42/50 (84.0%)
Claude Opus 4.5 · highIncomplete outcomes
0 / 50
0/50 (0.0%)
Percent labels are rounded to one decimal; counts give the exact shares. Four bands: 0–25%, >25–40%, >40–60%, >60%.
Different work, different outcomes
Workflow categories
Compare both models on the same task set in each category. Every task belongs to exactly one category.
GPT-5.2 · highClaude Opus 4.5 · high
Recorded pass rate
0%50%100%
Focus a marker for its exact pass count and run denominator. Select a category to see its tasks.GPT-5.2 · high, Cancellation: 8 of 28 retained runs pass; 0 unknown outcomes; 7 of 7 tasks covered.Claude Opus 4.5 · high, Cancellation: 13 of 28 retained runs pass; 0 unknown outcomes; 7 of 7 tasks covered.GPT-5.2 · high, Booking: 19 of 20 retained runs pass; 0 unknown outcomes; 5 of 5 tasks covered.Claude Opus 4.5 · high, Booking: 17 of 20 retained runs pass; 0 unknown outcomes; 5 of 5 tasks covered.GPT-5.2 · high, Reservation changes: 47 of 56 retained runs pass; 0 unknown outcomes; 14 of 14 tasks covered.Claude Opus 4.5 · high, Reservation changes: 45 of 56 retained runs pass; 0 unknown outcomes; 14 of 14 tasks covered.GPT-5.2 · high, Read-only / other: 92 of 96 retained runs pass; 0 unknown outcomes; 24 of 24 tasks covered.Claude Opus 4.5 · high, Read-only / other: 93 of 96 retained runs pass; 0 unknown outcomes; 24 of 24 tasks covered.
All tasks here are airline tasks. Categories are editorial labels from the task’s reference action tools, not independent benchmark domains or the agent’s observed actions.
Exact category rates, gaps and coverage
Gap = Claude Opus 4.5 · high minus GPT-5.2 · high, percentage points
Category
GPT-5.2 · high
Claude Opus 4.5 · high
Unrounded gap
Cancellation7 tasks
8/28 pass0 unknown · 7/7 tasks
13/28 pass0 unknown · 7/7 tasks
+17.857142857142858 pp
Booking5 tasks
19/20 pass0 unknown · 5/5 tasks
17/20 pass0 unknown · 5/5 tasks
-10 pp
Reservation changes14 tasks
47/56 pass0 unknown · 14/14 tasks
45/56 pass0 unknown · 14/14 tasks
-3.5714285714285716 pp
Read-only / other24 tasks
92/96 pass0 unknown · 24/24 tasks
93/96 pass0 unknown · 24/24 tasks
+1.0416666666666667 pp
Unknown outcomes remain in run denominators. A gap is unavailable if either model lacks runs for a task in that category. Trial counts may differ; these are descriptive rates without significance claims.
How task profiles and workflow categories are defined
Each model uses the same 50-task population. Difficulty bands count tasks equally; category rates count retained runs. The selected population contains 400 runs. Switching between matched and complete files can change trial counts and the resulting rates.
Category priority is fixed and mutually exclusive. A task with several reference actions takes the first matching rule below. If reference tool sets disagree across records, it is shown as unclassified; the model’s actual tool calls never determine its category.
Cancellation. A reference action calls cancel_reservation.
Booking. Otherwise, a reference action calls book_reservation.
Reservation changes. Otherwise, a reference action calls a tool beginning update_reservation_.
Refund / compensation. Otherwise, a reference action calls send_certificate, refund_reservation, or a tool beginning refund_.
Read-only / other. All remaining reference action sets, including empty sets.
Unclassified reference. Reference tool sets disagree between retained records for this task.
Method: gradia.public-reference-workflow-categories.v1. Classification does not establish policy compliance or task success. Identical task specifications do not establish identical user simulation, seeds or harness versions.
Shared failure pocket
3 tasks never pass for either model.
Every selected trial fails for both. Start with the task requirements and the tool sequence before changing the model.
Repeat-call signal
39 runs repeat an identical tool call.
Observed in 400/400 runs. Repetition can be a valid retry; inspect the sequence before treating it as waste.
Decision boundary
A benchmark pass is one piece of evidence.
These outcomes use the publisher’s reward. Your approval rules, business costs and recovery requirements need their own checks.
Buckets mix both models. Task difficulty and run length can be related; this is descriptive, not evidence that extra steps cause failure.
05 · Tool footprint
Which tools shape the work?
get reservation details
95.0%
95.5%
get user details
81.0%
93.0%
search direct flight
50.0%
44.5%
transfer to human agents
46.5%
31.5%
get flight status
41.0%
15.5%
search onestop flight
29.5%
26.0%
update reservation flights
24.5%
25.5%
book reservation
14.5%
14.5%
Top 8 tools by run coverage; each pair follows the model order above. One run may call several tools. Names alone do not establish correct arguments or results.
06 · Follow a point into the work
Inspect the runs behind the chart.
Filter, select a point, then follow its recorded tool sequence.
400 runs selected · 400 with both chart measurements
Select any point to inspect its run. Darker points pass; lighter points fail. Points can overlap; the table exposes every run.Select any point to inspect its run. Darker points pass; lighter points fail. Points can overlap; the table exposes every run.Task 46 · trial 1 · GPT-5.2 · high · pass · 3 messages / 1 tool callsTask 46 · trial 0 · GPT-5.2 · high · pass · 3 messages / 1 tool callsTask 36 · trial 0 · GPT-5.2 · high · pass · 5 messages / 6 tool callsTask 43 · trial 1 · GPT-5.2 · high · pass · 6 messages / 9 tool callsTask 13 · trial 0 · GPT-5.2 · high · pass · 5 messages / 2 tool callsTask 13 · trial 1 · GPT-5.2 · high · pass · 5 messages / 2 tool callsTask 43 · trial 0 · GPT-5.2 · high · pass · 6 messages / 8 tool callsTask 28 · trial 0 · GPT-5.2 · high · pass · 6 messages / 4 tool callsTask 27 · trial 1 · GPT-5.2 · high · pass · 6 messages / 3 tool callsTask 0 · trial 1 · GPT-5.2 · high · pass · 6 messages / 4 tool callsTask 9 · trial 1 · GPT-5.2 · high · pass · 6 messages / 8 tool callsTask 9 · trial 0 · GPT-5.2 · high · pass · 6 messages / 8 tool callsTask 36 · trial 1 · GPT-5.2 · high · pass · 6 messages / 6 tool callsTask 40 · trial 0 · GPT-5.2 · high · pass · 6 messages / 2 tool callsTask 41 · trial 0 · GPT-5.2 · high · pass · 7 messages / 16 tool callsTask 27 · trial 0 · GPT-5.2 · high · pass · 7 messages / 12 tool callsTask 23 · trial 0 · GPT-5.2 · high · fail · 6 messages / 6 tool callsTask 1 · trial 0 · GPT-5.2 · high · pass · 7 messages / 10 tool callsTask 40 · trial 1 · GPT-5.2 · high · pass · 6 messages / 2 tool callsTask 3 · trial 0 · GPT-5.2 · high · pass · 6 messages / 3 tool callsTask 48 · trial 0 · GPT-5.2 · high · pass · 7 messages / 3 tool callsTask 1 · trial 1 · GPT-5.2 · high · pass · 7 messages / 7 tool callsTask 5 · trial 1 · GPT-5.2 · high · pass · 7 messages / 7 tool callsTask 18 · trial 0 · GPT-5.2 · high · pass · 7 messages / 13 tool callsTask 41 · trial 1 · GPT-5.2 · high · pass · 7 messages / 9 tool callsTask 49 · trial 1 · GPT-5.2 · high · pass · 7 messages / 4 tool callsTask 29 · trial 0 · GPT-5.2 · high · fail · 6 messages / 5 tool callsTask 34 · trial 0 · GPT-5.2 · high · pass · 6 messages / 5 tool callsTask 26 · trial 1 · GPT-5.2 · high · pass · 7 messages / 4 tool callsTask 49 · trial 0 · GPT-5.2 · high · pass · 7 messages / 4 tool callsTask 28 · trial 1 · GPT-5.2 · high · pass · 7 messages / 4 tool callsTask 26 · trial 0 · GPT-5.2 · high · pass · 8 messages / 6 tool callsTask 3 · trial 1 · GPT-5.2 · high · pass · 7 messages / 3 tool callsTask 25 · trial 0 · GPT-5.2 · high · pass · 8 messages / 5 tool callsTask 11 · trial 1 · GPT-5.2 · high · pass · 8 messages / 7 tool callsTask 12 · trial 1 · GPT-5.2 · high · pass · 7 messages / 7 tool callsTask 16 · trial 0 · GPT-5.2 · high · pass · 8 messages / 6 tool callsTask 5 · trial 0 · GPT-5.2 · high · pass · 8 messages / 7 tool callsTask 25 · trial 1 · GPT-5.2 · high · pass · 8 messages / 4 tool callsTask 23 · trial 1 · GPT-5.2 · high · fail · 7 messages / 6 tool callsTask 17 · trial 0 · GPT-5.2 · high · pass · 8 messages / 8 tool callsTask 24 · trial 0 · GPT-5.2 · high · pass · 8 messages / 26 tool callsTask 37 · trial 1 · GPT-5.2 · high · pass · 8 messages / 9 tool callsTask 30 · trial 0 · GPT-5.2 · high · pass · 8 messages / 4 tool callsTask 45 · trial 0 · GPT-5.2 · high · fail · 7 messages / 2 tool callsTask 15 · trial 0 · GPT-5.2 · high · pass · 8 messages / 8 tool callsTask 21 · trial 0 · GPT-5.2 · high · pass · 9 messages / 14 tool callsTask 20 · trial 1 · GPT-5.2 · high · pass · 7 messages / 8 tool callsTask 8 · trial 0 · GPT-5.2 · high · pass · 8 messages / 8 tool callsTask 17 · trial 1 · GPT-5.2 · high · pass · 9 messages / 8 tool callsTask 0 · trial 0 · GPT-5.2 · high · pass · 8 messages / 4 tool callsTask 4 · trial 1 · GPT-5.2 · high · pass · 9 messages / 21 tool callsTask 12 · trial 0 · GPT-5.2 · high · pass · 9 messages / 7 tool callsTask 48 · trial 1 · GPT-5.2 · high · pass · 9 messages / 14 tool callsTask 30 · trial 1 · GPT-5.2 · high · pass · 9 messages / 4 tool callsTask 37 · trial 0 · GPT-5.2 · high · pass · 9 messages / 9 tool callsTask 8 · trial 1 · GPT-5.2 · high · pass · 9 messages / 8 tool callsTask 22 · trial 0 · GPT-5.2 · high · pass · 10 messages / 12 tool callsTask 29 · trial 1 · GPT-5.2 · high · fail · 9 messages / 7 tool callsTask 2 · trial 1 · GPT-5.2 · high · pass · 9 messages / 5 tool callsTask 11 · trial 0 · GPT-5.2 · high · pass · 11 messages / 7 tool callsTask 24 · trial 1 · GPT-5.2 · high · pass · 10 messages / 22 tool callsTask 4 · trial 0 · GPT-5.2 · high · pass · 12 messages / 18 tool callsTask 32 · trial 0 · GPT-5.2 · high · fail · 10 messages / 9 tool callsTask 20 · trial 0 · GPT-5.2 · high · pass · 9 messages / 8 tool callsTask 1 · trial 2 · GPT-5.2 · high · pass · 7 messages / 10 tool callsTask 19 · trial 1 · GPT-5.2 · high · pass · 10 messages / 10 tool callsTask 0 · trial 2 · GPT-5.2 · high · pass · 7 messages / 4 tool callsTask 39 · trial 0 · GPT-5.2 · high · fail · 10 messages / 16 tool callsTask 34 · trial 1 · GPT-5.2 · high · pass · 10 messages / 7 tool callsTask 31 · trial 0 · GPT-5.2 · high · pass · 10 messages / 10 tool callsTask 22 · trial 1 · GPT-5.2 · high · pass · 11 messages / 10 tool callsTask 38 · trial 1 · GPT-5.2 · high · pass · 11 messages / 16 tool callsTask 46 · trial 2 · GPT-5.2 · high · pass · 2 messages / 0 tool callsTask 13 · trial 2 · GPT-5.2 · high · pass · 4 messages / 1 tool callsTask 18 · trial 1 · GPT-5.2 · high · pass · 12 messages / 12 tool callsTask 39 · trial 1 · GPT-5.2 · high · fail · 12 messages / 29 tool callsTask 6 · trial 1 · GPT-5.2 · high · pass · 10 messages / 5 tool callsTask 5 · trial 2 · GPT-5.2 · high · pass · 6 messages / 7 tool callsTask 19 · trial 0 · GPT-5.2 · high · pass · 12 messages / 10 tool callsTask 3 · trial 2 · GPT-5.2 · high · pass · 6 messages / 3 tool callsTask 7 · trial 0 · GPT-5.2 · high · fail · 11 messages / 12 tool callsTask 47 · trial 1 · GPT-5.2 · high · pass · 10 messages / 2 tool callsTask 42 · trial 0 · GPT-5.2 · high · fail · 11 messages / 19 tool callsTask 16 · trial 1 · GPT-5.2 · high · pass · 11 messages / 6 tool callsTask 15 · trial 1 · GPT-5.2 · high · pass · 12 messages / 11 tool callsTask 35 · trial 0 · GPT-5.2 · high · pass · 12 messages / 11 tool callsTask 33 · trial 1 · GPT-5.2 · high · pass · 12 messages / 9 tool callsTask 47 · trial 0 · GPT-5.2 · high · pass · 11 messages / 3 tool callsTask 45 · trial 1 · GPT-5.2 · high · fail · 12 messages / 8 tool callsTask 31 · trial 1 · GPT-5.2 · high · fail · 12 messages / 18 tool callsTask 9 · trial 2 · GPT-5.2 · high · pass · 6 messages / 7 tool callsTask 14 · trial 0 · GPT-5.2 · high · pass · 12 messages / 10 tool callsTask 27 · trial 2 · GPT-5.2 · high · pass · 6 messages / 12 tool callsTask 4 · trial 2 · GPT-5.2 · high · pass · 7 messages / 7 tool callsTask 2 · trial 0 · GPT-5.2 · high · pass · 12 messages / 8 tool callsTask 14 · trial 1 · GPT-5.2 · high · pass · 13 messages / 10 tool callsTask 38 · trial 0 · GPT-5.2 · high · pass · 13 messages / 10 tool callsTask 33 · trial 0 · GPT-5.2 · high · pass · 12 messages / 8 tool callsTask 44 · trial 0 · GPT-5.2 · high · fail · 13 messages / 29 tool callsTask 0 · trial 3 · GPT-5.2 · high · pass · 5 messages / 2 tool callsTask 36 · trial 2 · GPT-5.2 · high · pass · 6 messages / 8 tool callsTask 7 · trial 1 · GPT-5.2 · high · fail · 14 messages / 12 tool callsTask 44 · trial 1 · GPT-5.2 · high · fail · 14 messages / 32 tool callsTask 8 · trial 2 · GPT-5.2 · high · pass · 8 messages / 8 tool callsTask 28 · trial 2 · GPT-5.2 · high · pass · 6 messages / 3 tool callsTask 11 · trial 2 · GPT-5.2 · high · pass · 8 messages / 7 tool callsTask 40 · trial 2 · GPT-5.2 · high · pass · 6 messages / 2 tool callsTask 35 · trial 1 · GPT-5.2 · high · pass · 14 messages / 8 tool callsTask 24 · trial 2 · GPT-5.2 · high · fail · 6 messages / 26 tool callsTask 34 · trial 2 · GPT-5.2 · high · pass · 6 messages / 4 tool callsTask 37 · trial 2 · GPT-5.2 · high · fail · 7 messages / 13 tool callsTask 49 · trial 2 · GPT-5.2 · high · pass · 6 messages / 2 tool callsTask 26 · trial 2 · GPT-5.2 · high · pass · 8 messages / 6 tool callsTask 19 · trial 2 · GPT-5.2 · high · fail · 8 messages / 8 tool callsTask 25 · trial 2 · GPT-5.2 · high · pass · 8 messages / 4 tool callsTask 43 · trial 2 · GPT-5.2 · high · pass · 7 messages / 8 tool callsTask 13 · trial 3 · GPT-5.2 · high · pass · 5 messages / 2 tool callsTask 1 · trial 3 · GPT-5.2 · high · pass · 7 messages / 7 tool callsTask 22 · trial 2 · GPT-5.2 · high · pass · 9 messages / 8 tool callsTask 10 · trial 0 · GPT-5.2 · high · pass · 16 messages / 15 tool callsTask 30 · trial 2 · GPT-5.2 · high · pass · 8 messages / 3 tool callsTask 46 · trial 3 · GPT-5.2 · high · pass · 3 messages / 1 tool callsTask 18 · trial 2 · GPT-5.2 · high · pass · 9 messages / 13 tool callsTask 21 · trial 1 · GPT-5.2 · high · pass · 18 messages / 18 tool callsTask 12 · trial 2 · GPT-5.2 · high · pass · 10 messages / 13 tool callsTask 10 · trial 1 · GPT-5.2 · high · pass · 15 messages / 31 tool callsTask 41 · trial 2 · GPT-5.2 · high · pass · 9 messages / 17 tool callsTask 36 · trial 3 · GPT-5.2 · high · pass · 5 messages / 6 tool callsTask 3 · trial 3 · GPT-5.2 · high · pass · 7 messages / 3 tool callsTask 9 · trial 3 · GPT-5.2 · high · pass · 7 messages / 10 tool callsTask 23 · trial 2 · GPT-5.2 · high · fail · 8 messages / 6 tool callsTask 17 · trial 2 · GPT-5.2 · high · pass · 11 messages / 11 tool callsTask 32 · trial 1 · GPT-5.2 · high · pass · 17 messages / 12 tool callsTask 42 · trial 1 · GPT-5.2 · high · fail · 17 messages / 23 tool callsTask 14 · trial 2 · GPT-5.2 · high · pass · 10 messages / 8 tool callsTask 48 · trial 2 · GPT-5.2 · high · pass · 9 messages / 4 tool callsTask 20 · trial 2 · GPT-5.2 · high · pass · 9 messages / 8 tool callsTask 28 · trial 3 · GPT-5.2 · high · pass · 6 messages / 4 tool callsTask 31 · trial 2 · GPT-5.2 · high · pass · 10 messages / 10 tool callsTask 21 · trial 2 · GPT-5.2 · high · pass · 11 messages / 17 tool callsTask 23 · trial 3 · GPT-5.2 · high · fail · 6 messages / 6 tool callsTask 39 · trial 2 · GPT-5.2 · high · fail · 10 messages / 11 tool callsTask 47 · trial 2 · GPT-5.2 · high · pass · 9 messages / 3 tool callsTask 11 · trial 3 · GPT-5.2 · high · pass · 8 messages / 7 tool callsTask 7 · trial 2 · GPT-5.2 · high · fail · 14 messages / 29 tool callsTask 33 · trial 2 · GPT-5.2 · high · pass · 10 messages / 7 tool callsTask 43 · trial 3 · GPT-5.2 · high · pass · 6 messages / 8 tool callsTask 38 · trial 2 · GPT-5.2 · high · pass · 9 messages / 4 tool callsTask 27 · trial 3 · GPT-5.2 · high · pass · 7 messages / 12 tool callsTask 31 · trial 3 · GPT-5.2 · high · pass · 7 messages / 6 tool callsTask 49 · trial 3 · GPT-5.2 · high · pass · 5 messages / 2 tool callsTask 24 · trial 3 · GPT-5.2 · high · pass · 7 messages / 23 tool callsTask 42 · trial 2 · GPT-5.2 · high · fail · 10 messages / 11 tool callsTask 29 · trial 2 · GPT-5.2 · high · fail · 10 messages / 7 tool callsTask 40 · trial 3 · GPT-5.2 · high · pass · 6 messages / 2 tool callsTask 15 · trial 2 · GPT-5.2 · high · pass · 11 messages / 8 tool callsTask 6 · trial 2 · GPT-5.2 · high · pass · 12 messages / 5 tool callsTask 4 · trial 3 · GPT-5.2 · high · pass · 10 messages / 11 tool callsTask 16 · trial 2 · GPT-5.2 · high · pass · 12 messages / 9 tool callsTask 26 · trial 3 · GPT-5.2 · high · pass · 8 messages / 6 tool callsTask 32 · trial 2 · GPT-5.2 · high · fail · 11 messages / 10 tool callsTask 34 · trial 3 · GPT-5.2 · high · pass · 6 messages / 5 tool callsTask 20 · trial 3 · GPT-5.2 · high · pass · 8 messages / 6 tool callsTask 12 · trial 3 · GPT-5.2 · high · pass · 9 messages / 11 tool callsTask 21 · trial 3 · GPT-5.2 · high · pass · 9 messages / 12 tool callsTask 25 · trial 3 · GPT-5.2 · high · pass · 9 messages / 5 tool callsTask 17 · trial 3 · GPT-5.2 · high · pass · 10 messages / 9 tool callsTask 15 · trial 3 · GPT-5.2 · high · pass · 9 messages / 8 tool callsTask 5 · trial 3 · GPT-5.2 · high · pass · 10 messages / 7 tool callsTask 19 · trial 3 · GPT-5.2 · high · pass · 9 messages / 9 tool callsTask 44 · trial 2 · GPT-5.2 · high · fail · 13 messages / 31 tool callsTask 30 · trial 3 · GPT-5.2 · high · pass · 8 messages / 3 tool callsTask 29 · trial 3 · GPT-5.2 · high · fail · 9 messages / 8 tool callsTask 47 · trial 3 · GPT-5.2 · high · pass · 7 messages / 2 tool callsTask 8 · trial 3 · GPT-5.2 · high · pass · 11 messages / 9 tool callsTask 14 · trial 3 · GPT-5.2 · high · pass · 10 messages / 8 tool callsTask 42 · trial 3 · GPT-5.2 · high · pass · 8 messages / 14 tool callsTask 35 · trial 2 · GPT-5.2 · high · pass · 12 messages / 11 tool callsTask 41 · trial 3 · GPT-5.2 · high · pass · 9 messages / 17 tool callsTask 37 · trial 3 · GPT-5.2 · high · pass · 9 messages / 13 tool callsTask 22 · trial 3 · GPT-5.2 · high · pass · 12 messages / 8 tool callsTask 38 · trial 3 · GPT-5.2 · high · pass · 8 messages / 7 tool callsTask 10 · trial 2 · GPT-5.2 · high · pass · 14 messages / 20 tool callsTask 16 · trial 3 · GPT-5.2 · high · pass · 11 messages / 6 tool callsTask 48 · trial 3 · GPT-5.2 · high · pass · 9 messages / 13 tool callsTask 44 · trial 3 · GPT-5.2 · high · fail · 9 messages / 26 tool callsTask 2 · trial 2 · GPT-5.2 · high · pass · 19 messages / 251 tool callsTask 6 · trial 0 · GPT-5.2 · high · fail · 20 messages / 14 tool callsTask 39 · trial 3 · GPT-5.2 · high · fail · 11 messages / 11 tool callsTask 32 · trial 3 · GPT-5.2 · high · fail · 12 messages / 11 tool callsTask 33 · trial 3 · GPT-5.2 · high · pass · 11 messages / 8 tool callsTask 7 · trial 3 · GPT-5.2 · high · fail · 16 messages / 30 tool callsTask 45 · trial 2 · GPT-5.2 · high · pass · 13 messages / 7 tool callsTask 18 · trial 3 · GPT-5.2 · high · fail · 15 messages / 42 tool callsTask 2 · trial 3 · GPT-5.2 · high · pass · 14 messages / 19 tool callsTask 35 · trial 3 · GPT-5.2 · high · pass · 11 messages / 8 tool callsTask 45 · trial 3 · GPT-5.2 · high · pass · 14 messages / 6 tool callsTask 6 · trial 3 · GPT-5.2 · high · pass · 19 messages / 8 tool callsTask 10 · trial 3 · GPT-5.2 · high · pass · 12 messages / 16 tool callsTask 46 · trial 1 · Claude Opus 4.5 · high · pass · 2 messages / 0 tool callsTask 46 · trial 0 · Claude Opus 4.5 · high · pass · 4 messages / 1 tool callsTask 36 · trial 1 · Claude Opus 4.5 · high · pass · 4 messages / 1 tool callsTask 3 · trial 1 · Claude Opus 4.5 · high · pass · 5 messages / 3 tool callsTask 40 · trial 1 · Claude Opus 4.5 · high · pass · 6 messages / 2 tool callsTask 36 · trial 0 · Claude Opus 4.5 · high · pass · 5 messages / 2 tool callsTask 40 · trial 0 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 16 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 6 tool callsTask 12 · trial 0 · Claude Opus 4.5 · high · pass · 7 messages / 5 tool callsTask 3 · trial 0 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 37 · trial 1 · Claude Opus 4.5 · high · pass · 6 messages / 7 tool callsTask 29 · trial 0 · Claude Opus 4.5 · high · fail · 5 messages / 5 tool callsTask 25 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 4 tool callsTask 44 · trial 0 · Claude Opus 4.5 · high · fail · 7 messages / 18 tool callsTask 18 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 13 tool callsTask 48 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 11 tool callsTask 0 · trial 0 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 41 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 9 tool callsTask 26 · trial 0 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 48 · trial 0 · Claude Opus 4.5 · high · pass · 7 messages / 3 tool callsTask 26 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 4 tool callsTask 0 · trial 1 · Claude Opus 4.5 · high · pass · 5 messages / 1 tool callsTask 13 · trial 0 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 13 · trial 1 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 28 · trial 1 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 49 · trial 1 · Claude Opus 4.5 · high · pass · 8 messages / 3 tool callsTask 8 · trial 1 · Claude Opus 4.5 · high · pass · 9 messages / 9 tool callsTask 19 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 5 tool callsTask 12 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 4 tool callsTask 49 · trial 0 · Claude Opus 4.5 · high · pass · 7 messages / 3 tool callsTask 15 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 8 tool callsTask 1 · trial 1 · Claude Opus 4.5 · high · pass · 8 messages / 7 tool callsTask 19 · trial 1 · Claude Opus 4.5 · high · pass · 9 messages / 6 tool callsTask 29 · trial 1 · Claude Opus 4.5 · high · fail · 9 messages / 7 tool callsTask 4 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 9 tool callsTask 1 · trial 0 · Claude Opus 4.5 · high · pass · 7 messages / 6 tool callsTask 11 · trial 0 · Claude Opus 4.5 · high · pass · 9 messages / 7 tool callsTask 34 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 4 tool callsTask 17 · trial 0 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 39 · trial 1 · Claude Opus 4.5 · high · fail · 8 messages / 11 tool callsTask 42 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 10 tool callsTask 28 · trial 0 · Claude Opus 4.5 · high · pass · 7 messages / 3 tool callsTask 8 · trial 0 · Claude Opus 4.5 · high · fail · 9 messages / 8 tool callsTask 22 · trial 0 · Claude Opus 4.5 · high · pass · 10 messages / 9 tool callsTask 22 · trial 1 · Claude Opus 4.5 · high · pass · 8 messages / 9 tool callsTask 18 · trial 0 · Claude Opus 4.5 · high · fail · 7 messages / 19 tool callsTask 4 · trial 1 · Claude Opus 4.5 · high · pass · 8 messages / 9 tool callsTask 43 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 8 tool callsTask 38 · trial 1 · Claude Opus 4.5 · high · pass · 9 messages / 6 tool callsTask 30 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 4 tool callsTask 30 · trial 1 · Claude Opus 4.5 · high · pass · 8 messages / 4 tool callsTask 39 · trial 0 · Claude Opus 4.5 · high · fail · 8 messages / 11 tool callsTask 24 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 17 tool callsTask 38 · trial 0 · Claude Opus 4.5 · high · pass · 9 messages / 6 tool callsTask 42 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 10 tool callsTask 27 · trial 1 · Claude Opus 4.5 · high · pass · 8 messages / 12 tool callsTask 9 · trial 1 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 17 · trial 1 · Claude Opus 4.5 · high · pass · 11 messages / 9 tool callsTask 24 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 16 tool callsTask 43 · trial 1 · Claude Opus 4.5 · high · pass · 7 messages / 7 tool callsTask 32 · trial 0 · Claude Opus 4.5 · high · fail · 8 messages / 8 tool callsTask 37 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 9 tool callsTask 16 · trial 0 · Claude Opus 4.5 · high · pass · 9 messages / 6 tool callsTask 15 · trial 1 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 41 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 9 tool callsTask 11 · trial 1 · Claude Opus 4.5 · high · pass · 9 messages / 7 tool callsTask 33 · trial 0 · Claude Opus 4.5 · high · pass · 10 messages / 7 tool callsTask 0 · trial 2 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 25 · trial 0 · Claude Opus 4.5 · high · pass · 10 messages / 5 tool callsTask 44 · trial 1 · Claude Opus 4.5 · high · fail · 8 messages / 27 tool callsTask 32 · trial 1 · Claude Opus 4.5 · high · fail · 10 messages / 8 tool callsTask 20 · trial 1 · Claude Opus 4.5 · high · pass · 9 messages / 4 tool callsTask 34 · trial 0 · Claude Opus 4.5 · high · pass · 12 messages / 9 tool callsTask 33 · trial 1 · Claude Opus 4.5 · high · pass · 11 messages / 6 tool callsTask 14 · trial 0 · Claude Opus 4.5 · high · pass · 10 messages / 8 tool callsTask 9 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 5 tool callsTask 13 · trial 2 · Claude Opus 4.5 · high · pass · 5 messages / 2 tool callsTask 20 · trial 0 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 1 · trial 2 · Claude Opus 4.5 · high · pass · 7 messages / 7 tool callsTask 3 · trial 2 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 5 · trial 1 · Claude Opus 4.5 · high · pass · 8 messages / 6 tool callsTask 2 · trial 1 · Claude Opus 4.5 · high · pass · 10 messages / 13 tool callsTask 6 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 2 tool callsTask 45 · trial 0 · Claude Opus 4.5 · high · pass · 8 messages / 4 tool callsTask 11 · trial 2 · Claude Opus 4.5 · high · pass · 8 messages / 7 tool callsTask 21 · trial 0 · Claude Opus 4.5 · high · fail · 13 messages / 15 tool callsTask 4 · trial 2 · Claude Opus 4.5 · high · pass · 7 messages / 8 tool callsTask 5 · trial 0 · Claude Opus 4.5 · high · pass · 7 messages / 6 tool callsTask 31 · trial 1 · Claude Opus 4.5 · high · fail · 12 messages / 10 tool callsTask 28 · trial 2 · Claude Opus 4.5 · high · pass · 4 messages / 2 tool callsTask 7 · trial 0 · Claude Opus 4.5 · high · fail · 11 messages / 13 tool callsTask 36 · trial 2 · Claude Opus 4.5 · high · pass · 5 messages / 2 tool callsTask 35 · trial 1 · Claude Opus 4.5 · high · pass · 10 messages / 8 tool callsTask 9 · trial 2 · Claude Opus 4.5 · high · pass · 7 messages / 6 tool callsTask 47 · trial 0 · Claude Opus 4.5 · high · pass · 11 messages / 3 tool callsTask 31 · trial 0 · Claude Opus 4.5 · high · fail · 11 messages / 9 tool callsTask 47 · trial 1 · Claude Opus 4.5 · high · pass · 11 messages / 2 tool callsTask 16 · trial 2 · Claude Opus 4.5 · high · pass · 8 messages / 6 tool callsTask 46 · trial 2 · Claude Opus 4.5 · high · pass · 4 messages / 1 tool callsTask 26 · trial 2 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 21 · trial 1 · Claude Opus 4.5 · high · pass · 10 messages / 12 tool callsTask 17 · trial 2 · Claude Opus 4.5 · high · pass · 9 messages / 9 tool callsTask 2 · trial 0 · Claude Opus 4.5 · high · pass · 13 messages / 21 tool callsTask 20 · trial 2 · Claude Opus 4.5 · high · pass · 8 messages / 8 tool callsTask 40 · trial 2 · Claude Opus 4.5 · high · pass · 6 messages / 2 tool callsTask 10 · trial 1 · Claude Opus 4.5 · high · pass · 16 messages / 15 tool callsTask 19 · trial 2 · Claude Opus 4.5 · high · pass · 8 messages / 5 tool callsTask 39 · trial 2 · Claude Opus 4.5 · high · fail · 5 messages / 8 tool callsTask 8 · trial 2 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 7 · trial 1 · Claude Opus 4.5 · high · pass · 13 messages / 17 tool callsTask 15 · trial 2 · Claude Opus 4.5 · high · pass · 8 messages / 8 tool callsTask 23 · trial 1 · Claude Opus 4.5 · high · fail · 10 messages / 10 tool callsTask 13 · trial 3 · Claude Opus 4.5 · high · pass · 4 messages / 1 tool callsTask 7 · trial 2 · Claude Opus 4.5 · high · fail · 9 messages / 10 tool callsTask 45 · trial 1 · Claude Opus 4.5 · high · pass · 9 messages / 2 tool callsTask 0 · trial 3 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 14 · trial 1 · Claude Opus 4.5 · high · pass · 14 messages / 11 tool callsTask 43 · trial 2 · Claude Opus 4.5 · high · pass · 7 messages / 8 tool callsTask 24 · trial 2 · Claude Opus 4.5 · high · pass · 7 messages / 16 tool callsTask 3 · trial 3 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 48 · trial 2 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 25 · trial 2 · Claude Opus 4.5 · high · pass · 9 messages / 4 tool callsTask 49 · trial 2 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 42 · trial 2 · Claude Opus 4.5 · high · pass · 7 messages / 10 tool callsTask 4 · trial 3 · Claude Opus 4.5 · high · pass · 6 messages / 6 tool callsTask 30 · trial 2 · Claude Opus 4.5 · high · pass · 8 messages / 4 tool callsTask 11 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 7 tool callsTask 41 · trial 2 · Claude Opus 4.5 · high · pass · 8 messages / 9 tool callsTask 12 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 4 tool callsTask 16 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 6 tool callsTask 21 · trial 2 · Claude Opus 4.5 · high · pass · 10 messages / 12 tool callsTask 14 · trial 2 · Claude Opus 4.5 · high · fail · 10 messages / 8 tool callsTask 12 · trial 2 · Claude Opus 4.5 · high · pass · 10 messages / 6 tool callsTask 22 · trial 2 · Claude Opus 4.5 · high · pass · 9 messages / 9 tool callsTask 23 · trial 0 · Claude Opus 4.5 · high · fail · 11 messages / 11 tool callsTask 1 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 7 tool callsTask 27 · trial 3 · Claude Opus 4.5 · high · pass · 5 messages / 3 tool callsTask 44 · trial 2 · Claude Opus 4.5 · high · fail · 7 messages / 26 tool callsTask 37 · trial 2 · Claude Opus 4.5 · high · pass · 9 messages / 7 tool callsTask 28 · trial 3 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 10 · trial 2 · Claude Opus 4.5 · high · pass · 13 messages / 14 tool callsTask 2 · trial 2 · Claude Opus 4.5 · high · pass · 11 messages / 24 tool callsTask 34 · trial 2 · Claude Opus 4.5 · high · pass · 10 messages / 7 tool callsTask 36 · trial 3 · Claude Opus 4.5 · high · pass · 5 messages / 2 tool callsTask 29 · trial 2 · Claude Opus 4.5 · high · pass · 10 messages / 7 tool callsTask 18 · trial 2 · Claude Opus 4.5 · high · pass · 9 messages / 24 tool callsTask 8 · trial 3 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 19 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 5 tool callsTask 25 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 4 tool callsTask 46 · trial 3 · Claude Opus 4.5 · high · pass · 4 messages / 1 tool callsTask 5 · trial 2 · Claude Opus 4.5 · high · pass · 8 messages / 6 tool callsTask 26 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 4 tool callsTask 22 · trial 3 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 29 · trial 3 · Claude Opus 4.5 · high · fail · 7 messages / 7 tool callsTask 6 · trial 2 · Claude Opus 4.5 · high · pass · 9 messages / 2 tool callsTask 40 · trial 3 · Claude Opus 4.5 · high · pass · 6 messages / 2 tool callsTask 18 · trial 3 · Claude Opus 4.5 · high · pass · 11 messages / 12 tool callsTask 35 · trial 0 · Claude Opus 4.5 · high · pass · 13 messages / 8 tool callsTask 9 · trial 3 · Claude Opus 4.5 · high · pass · 10 messages / 9 tool callsTask 7 · trial 3 · Claude Opus 4.5 · high · fail · 10 messages / 13 tool callsTask 39 · trial 3 · Claude Opus 4.5 · high · fail · 5 messages / 8 tool callsTask 30 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 4 tool callsTask 24 · trial 3 · Claude Opus 4.5 · high · pass · 9 messages / 17 tool callsTask 41 · trial 3 · Claude Opus 4.5 · high · pass · 6 messages / 8 tool callsTask 21 · trial 3 · Claude Opus 4.5 · high · pass · 9 messages / 12 tool callsTask 49 · trial 3 · Claude Opus 4.5 · high · pass · 6 messages / 3 tool callsTask 5 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 6 tool callsTask 15 · trial 3 · Claude Opus 4.5 · high · fail · 9 messages / 8 tool callsTask 10 · trial 0 · Claude Opus 4.5 · high · pass · 40 messages / 72 tool callsTask 42 · trial 3 · Claude Opus 4.5 · high · pass · 7 messages / 10 tool callsTask 48 · trial 3 · Claude Opus 4.5 · high · pass · 7 messages / 3 tool callsTask 20 · trial 3 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 31 · trial 2 · Claude Opus 4.5 · high · pass · 11 messages / 8 tool callsTask 14 · trial 3 · Claude Opus 4.5 · high · pass · 9 messages / 8 tool callsTask 38 · trial 2 · Claude Opus 4.5 · high · pass · 12 messages / 5 tool callsTask 33 · trial 2 · Claude Opus 4.5 · high · pass · 12 messages / 8 tool callsTask 32 · trial 2 · Claude Opus 4.5 · high · pass · 14 messages / 10 tool callsTask 34 · trial 3 · Claude Opus 4.5 · high · pass · 7 messages / 5 tool callsTask 6 · trial 3 · Claude Opus 4.5 · high · pass · 9 messages / 2 tool callsTask 47 · trial 2 · Claude Opus 4.5 · high · pass · 11 messages / 2 tool callsTask 31 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 8 tool callsTask 38 · trial 3 · Claude Opus 4.5 · high · pass · 10 messages / 6 tool callsTask 45 · trial 2 · Claude Opus 4.5 · high · pass · 10 messages / 5 tool callsTask 2 · trial 3 · Claude Opus 4.5 · high · pass · 14 messages / 20 tool callsTask 32 · trial 3 · Claude Opus 4.5 · high · fail · 9 messages / 7 tool callsTask 43 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 7 tool callsTask 17 · trial 3 · Claude Opus 4.5 · high · pass · 12 messages / 9 tool callsTask 27 · trial 0 · Claude Opus 4.5 · high · pass · 7 messages / 12 tool callsTask 27 · trial 2 · Claude Opus 4.5 · high · pass · 7 messages / 12 tool callsTask 37 · trial 3 · Claude Opus 4.5 · high · pass · 9 messages / 10 tool callsTask 45 · trial 3 · Claude Opus 4.5 · high · pass · 8 messages / 2 tool callsTask 44 · trial 3 · Claude Opus 4.5 · high · fail · 9 messages / 28 tool callsTask 35 · trial 2 · Claude Opus 4.5 · high · fail · 12 messages / 9 tool callsTask 33 · trial 3 · Claude Opus 4.5 · high · fail · 13 messages / 5 tool callsTask 47 · trial 3 · Claude Opus 4.5 · high · pass · 11 messages / 2 tool callsTask 10 · trial 3 · Claude Opus 4.5 · high · pass · 16 messages / 16 tool callsTask 6 · trial 1 · Claude Opus 4.5 · high · fail · 20 messages / 6 tool callsTask 35 · trial 3 · Claude Opus 4.5 · high · fail · 10 messages / 8 tool callsTask 23 · trial 2 · Claude Opus 4.5 · high · fail · 21 messages / 21 tool callsTask 23 · trial 3 · Claude Opus 4.5 · high · fail · 13 messages / 11 tool calls
Cost / latency coverage: 400/400 · 400/400Cost is upstream model-priced agent spend, not audited billing. Duration is full simulation wall time, including simulated-user and tool work.
Run / model
Outcome
Messages
Tools
Repeats
pass
3
1
0
pass
3
1
0
pass
5
6
0
pass
6
9
0
pass
5
2
0
pass
5
2
0
pass
6
8
0
pass
6
4
0
pass
6
3
0
pass
6
4
0
pass
6
8
0
pass
6
8
0
1–12 of 400
Trace inspection · task 46 · trial 1
The conversation. The calls. The results.
Published simulated benchmark data. Read-only historical evidence; nothing here executes tools.
Source provenance, reproduction and what these results establish
This dashboard analyzes complete pinned public benchmark files, with no selection based on outcome. It preserves the publisher’s rewards; Gradia did not execute these models or independently regrade these tasks. Same task specs, trial keys, recorded seeds and shared recorded configuration. Historical runtime dependencies were not independently reproduced. Matching recorded configuration or seeds does not guarantee identical stochastic interactions. Repeated trials on the same task are not independent evidence about all enterprise work.
The rates, gaps, tool coverage and sequences are deterministic calculations. They describe this sample; they are not AI-generated causal explanations, confidence intervals or current model recommendations. Assistant messages measure sequence length, not elapsed time. Repeated calls may be legitimate.
Source: Sierra Research · τ2-bench · recorded cost and performance, MIT license. Upstream commit 2174a603f6d014ef94473ffa95957f6ce27100db. Full source pins and run fingerprints are included in the downloadable JSON report. See the repository generator for reproducible extraction.
From benchmark numbers to your decision
Now ask what “pass” means for your business.
Use your cases and requirements to compare agents, inspect the evidence and identify the next tests. The replay lab below shows why that extra layer matters.
Keep a public record’s final answer unchanged. Alter its evidence, then inspect exactly which requirement catches the difference.
Public historical traces + deliberately authored replay faults. This replay lab demonstrates Gradia’s checks, not fresh model performance, rankings or independent task success.
01 · Choose a workflow
Delegated agent work
Same answer. Wrong branch.
One authored variant moves a successful tool result outside its required delegated branch. The other marks a delegated run as failed. Both retain the original final answer.
What does the check see?
Switch from the copied answer to the evidence behind it.
PassFailUnknownCounts of replay attempts
Published source replay2 pass / 2 planned
Authored comparison variant2 fail / 2 planned
A required failure blocks a pass. Missing evidence remains unknown. Select a segment to inspect its meaning.
Exact chart counts and denominators
TRAIL: output preservation and required evidence
Replay
Copied output passes
Evidence pass
Evidence fail
Evidence unknown
Published source replay
2 / 2
2 / 2
0 / 2
0 / 2
Authored comparison variant
2 / 2
0 / 2
2 / 2
0 / 2
See the actual structural change
Right result. Wrong place.
Simplified view of one selected replay pair.
Manager
Manager step 1
Required branch
Required search agent
Search agent step 3
Successful web_search resultArguments and result unchanged
Manager step 2
A different step of the same manager
Frozen requirement
The result must belong to the required search-agent branch.
Pass · Result is inside the branch
The successful tool span is a child of the search agent’s step 3.
=
Final answer: unchangedCopied-output preservation still passes.
This is recorded span containment, not a live execution or a restored application. Other spans and wrapper nodes are omitted. The other TRAIL pair in the chart uses a different authored fault.
Each row is one exact frozen rule. Select it to compare the two sides.
2 of 4 evidence requirements shown
Requirement
Source
Authored variant
1 pass/ 1 applicable
1 fail/ 1 applicable
1 pass/ 1 applicable
1 fail/ 1 applicable
Several criteria can apply to one attempt. Do not add criterion counts to estimate the number of failed attempts.
03 · Make the next test useful
What would matter in your workflow?
A result from another branch cannot satisfy the work you assigned to this one. Check who did the work and whether the required delegation completed.
A practical next step: Define which delegated branch must produce the result, then preserve that requirement as a regression test.
These are recorded execution trees, not restored application worlds. The changed branch and failure are deliberate demo edits, not newly observed model mistakes.
04 · Understand the limits
A reproducible example. A bounded claim.
9 selected public records, 18 replay attempts. Across this replay catalog, 18 copied-output checks pass; required evidence records 4 pass, 11 fail and 3 unknown. These are inventory counts across different requirements, not a pooled performance score.
Historical cost and latency are unknown for all 18 replay attempts. This lab draws no cost chart. Its offline qualification made no model or network calls.
What “output pass” means
Typed JSON equality with the copied source output. Demonstrates preservation, not task correctness.
What “evidence pass” means
Outcome under the demo's frozen required evidence assertions. Fail if a required assertion fails; otherwise unknown if required evidence is insufficient; otherwise pass.
What changed
7 of 9 same-answer pairs have different required-evidence patterns. The variants are authored edits, not new observations of the upstream agents.
Reproduction and receipt identity
All replay-lab counts are a curated projection of the offline four-source qualification receipt. Downloading exports this same aggregate data, source pins, definitions, and the selected public span relationships. It contains no raw prompts, tool payloads, screenshots or customer records.
Attribution is not endorsement. Original materials retain their publishers’ MIT license notices. This replay lab redistributes aggregate measurements, selected span relationships and authored explanations only.
TRAIL ↗Patronus AI · MITSource pin0ffbed9db859b4a66250dc783fa4dccf86869595
Bring your agent or traces, one workflow, and the decision you need to make. Agree the requirements, evaluate the evidence, and leave with a reviewable report and the next tests to run.