rerun-bench report

Same task, run N times. Generated 2026-10-03T08:26:33+00:00 by rerun-bench 0.1.0. 2 result set(s), 10 task(s), k = 3.

Leaderboard

Click a column to sort. CV columns are the mean within-task coefficient of variation (std / mean across reruns of the same task).

Agent / modelCLI versionRuns/taskPass rate [95% CI]pass@kpass^kFlip rateFlaky tasksCost/runCost CVTokens CVWall medianWall CVApproach sim.
claude / claude-opus-5-5
claude
2.1.288 (Claude Code)3100% [89, 100]100%100%0%0%$0.09380.050.0412.6s0.180.81
codex / gpt-6-luna
codex
codex-cli 0.160.0393% [79, 98]100%80%13%20%n/an/a0.1416.1s0.210.77

Per-task consistency

Each square is one run, in run order: green passed, red failed. Hover a cell for CI, flip rate, cost and wall-time CV, and approach similarity.

Taskclaude / claude-opus-5-5codex / gpt-6-luna
add-cli-flag100%flip 0%100%flip 0%
edit-config100%flip 0%100%flip 0%
fix-failing-test100%flip 0%100%flip 0%
follow-agents-md100%flip 0%100%flip 0%
implement-lru-cache100%flip 0%67%flip 67%
implement-slugify100%flip 0%100%flip 0%
minimal-fix100%flip 0%100%flip 0%
multi-file-rename100%flip 0%100%flip 0%
refactor-extract-helper100%flip 0%67%flip 67%
write-tests100%flip 0%100%flip 0%

Metric definitions

Pass rate
passes / runs, pooled over tasks, with a Wilson 95% interval.
pass@k
P(at least one of k reruns passes), unbiased estimator, averaged over tasks.
pass^k
P(all k reruns pass), unbiased estimator, averaged over tasks.
Flip rate
P(two reruns of the same task disagree) = 2c(n-c)/(n(n-1)), averaged over tasks.
Flaky tasks
Share of tasks with at least one pass and at least one fail.
Cost / tokens / wall CV
Sample std / mean across reruns of one task, averaged over tasks.
Approach sim.
Mean pairwise Jaccard similarity of changed-line sets among passing runs. 1.0 means every passing run made the same edit.