Eval Report: ci-pr-smoke

Profile: gdm-swebench-lite-v1 | Tasks: 15 | Pass rate: 100.0% | Cost: $0.0150

Task IDBandScorePassedCost
python-security-fix-easy-001easy0.740$0.0010
typescript-security-fix-easy-001easy0.740$0.0010
python-bugfix-easy-001easy0.740$0.0010
typescript-bugfix-easy-001easy0.740$0.0010
python-performance-easy-001easy0.740$0.0010
typescript-performance-easy-001easy0.740$0.0010
python-test-writing-easy-001easy0.740$0.0010
typescript-test-writing-easy-001easy0.740$0.0010
python-multi-file-easy-001easy0.740$0.0010
typescript-multi-file-easy-001easy0.740$0.0010
python-refactor-easy-001easy0.740$0.0010
typescript-refactor-easy-001easy0.740$0.0010
python-config-easy-001easy0.740$0.0010
typescript-config-easy-001easy0.740$0.0010
python-recovery-easy-001easy0.740$0.0010

Leaderboard Snapshot

Latest run: f18a81ac-5888-4a4d-b4df-89f4b8cf27c5 | Latest model: coder | Latest score: 0.740 | Recorded at: 2026-05-22T13:49:25.282858+00:00

Recent Trend

Run IDModelGit SHAScoreCreated
f18a81ac-5888-4a4d-b4df-89f4b8cf27c5coder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-22T13:49:25.282858+00:00
dc304c73-067a-461c-8b52-7800160a1240coder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-22T13:49:25.102348+00:00
d8e0079f-f335-448e-9b28-07a027179037coder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-22T13:49:24.944467+00:00
c306da61-ac3c-44c0-9985-6d07d12ab87bcoder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-22T13:49:24.794291+00:00
79e00afb-7b99-47ef-b2fa-cebc05c836afcoder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-22T13:49:24.619448+00:00

Failure Breakdown

TaxonomyFailuresBar
wrong-logic2335
###############################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################

Recent Failures

Run IDTask IDTaxonomyScoreCostCreated
f18a81ac-5888-4a4d-b4df-89f4b8cf27c5python-recovery-easy-001wrong-logic0.740$0.00102026-05-22T13:49:25.282858+00:00
dc304c73-067a-461c-8b52-7800160a1240typescript-config-easy-001wrong-logic0.740$0.00102026-05-22T13:49:25.102348+00:00
d8e0079f-f335-448e-9b28-07a027179037python-config-easy-001wrong-logic0.740$0.00102026-05-22T13:49:24.944467+00:00
c306da61-ac3c-44c0-9985-6d07d12ab87btypescript-refactor-easy-001wrong-logic0.740$0.00102026-05-22T13:49:24.794291+00:00
79e00afb-7b99-47ef-b2fa-cebc05c836afpython-refactor-easy-001wrong-logic0.740$0.00102026-05-22T13:49:24.619448+00:00
36afc305-ffd6-46d5-82ea-9f839b0cb2dbtypescript-multi-file-easy-001wrong-logic0.740$0.00102026-05-22T13:49:24.379518+00:00
f48e2e4c-6f98-4b86-aef5-466f96d164ebpython-multi-file-easy-001wrong-logic0.740$0.00102026-05-22T13:49:24.213086+00:00
bfc5a487-af61-47ce-b91f-1c552e0e5052typescript-test-writing-easy-001wrong-logic0.740$0.00102026-05-22T13:49:24.073913+00:00
5d939752-2da1-475b-acd8-043736ae29a9python-test-writing-easy-001wrong-logic0.740$0.00102026-05-22T13:49:23.917343+00:00
5ec4ec28-3213-4b51-a797-c3d46334048etypescript-performance-easy-001wrong-logic0.740$0.00102026-05-22T13:49:23.731868+00:00

Cost Frontier

pass_rate vs cost_usd (Pareto frontier marked with *)
* [####################] 100.0% @ $0.0039  (coder)