Eval Report: ci-pr-smoke

Profile: gdm-swebench-lite-v1 | Tasks: 2 | Pass rate: 100.0% | Cost: $0.0020

Task IDBandScorePassedCost
python-security-fix-easy-001easy0.740$0.0010
typescript-security-fix-easy-001easy0.740$0.0010

Leaderboard Snapshot

Latest run: 87677b74-a543-4ffe-941d-79f01c6e05d7 | Latest model: coder | Latest score: 0.740 | Recorded at: 2026-05-09T14:20:49.458336+00:00

Recent Trend

Run IDModelGit SHAScoreCreated
87677b74-a543-4ffe-941d-79f01c6e05d7coder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-09T14:20:49.458336+00:00
09ef877b-1a62-41a3-b97e-5251b2949a48coder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-09T14:20:49.377031+00:00
5b088bd6-9575-45a9-9c21-56d94fdf5850coder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-09T14:20:47.834449+00:00
5d828fb5-d2e9-4aca-a12b-0403e05ac2bfcoder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-09T14:20:47.725356+00:00
bd03c245-3b57-43e3-ad84-7a3b26451a93coder4669773b4fbe9d507f1396f38777a1b36998faf30.7402026-05-09T14:20:47.616275+00:00

Failure Breakdown

TaxonomyFailuresBar
wrong-logic1897
#########################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################################

Recent Failures

Run IDTask IDTaxonomyScoreCostCreated
87677b74-a543-4ffe-941d-79f01c6e05d7typescript-security-fix-easy-001wrong-logic0.740$0.00102026-05-09T14:20:49.458336+00:00
09ef877b-1a62-41a3-b97e-5251b2949a48python-security-fix-easy-001wrong-logic0.740$0.00102026-05-09T14:20:49.377031+00:00
5b088bd6-9575-45a9-9c21-56d94fdf5850python-recovery-easy-001wrong-logic0.740$0.00102026-05-09T14:20:47.834449+00:00
5d828fb5-d2e9-4aca-a12b-0403e05ac2bftypescript-config-easy-001wrong-logic0.740$0.00102026-05-09T14:20:47.725356+00:00
bd03c245-3b57-43e3-ad84-7a3b26451a93python-config-easy-001wrong-logic0.740$0.00102026-05-09T14:20:47.616275+00:00
4405b656-2da0-4f01-8617-2bafaa46dd6btypescript-refactor-easy-001wrong-logic0.740$0.00102026-05-09T14:20:47.503071+00:00
2631864a-16ba-4399-8c5f-f4ab26255128python-refactor-easy-001wrong-logic0.740$0.00102026-05-09T14:20:47.415465+00:00
2d141e51-7d13-4f7c-9941-1eb0e22d2acftypescript-multi-file-easy-001wrong-logic0.740$0.00102026-05-09T14:20:47.316447+00:00
5ae5895d-27df-4475-960e-eac9f523ea3dpython-multi-file-easy-001wrong-logic0.740$0.00102026-05-09T14:20:47.204716+00:00
1faa31df-ffe3-46d7-bd1d-840c28710fc5typescript-test-writing-easy-001wrong-logic0.740$0.00102026-05-09T14:20:47.009626+00:00

Cost Frontier

pass_rate vs cost_usd (Pareto frontier marked with *)
* [####################] 100.0% @ $0.0042  (coder)