muteval — eval quality report card
1 of 6 probes flagged an issue — core = catches a real eval defect · validity = needs labels · hygiene = sanity check (a WARN here is a footnote) — no composite score (each signal stands on its own).
PASS
judge_reliabilitycore
0/3 verdicts flipped across 3 runs = 0% flaky (Krippendorff alpha 1.00)
stable (<= 5% flip target; alpha near 1).
PASS
discriminationcore
not assessed (no good/bad exemplars provided)
add per-case 'good' and 'bad' example outputs to enable this probe.
PASS
human_agreementvalidity
not assessed (no human labels)
run `muteval label` to emit a worksheet, fill it, save as .muteval\labels.csv.
WARN
statistical_adequacyhygiene
3/3 cases pass = 100% [95% CI 44-100%]
CI too wide (+/-28%) to trust the number — add cases (~9 for +/-15%).
PASS
redundancyhygiene
not assessed (need >= 2 evals)
needs >= 2 evals and >= 3 cases whose scores vary.
PASS
threshold_calibrationhygiene
not assessed (no good/bad exemplars provided)
add per-case 'good' and 'bad' example outputs to enable this probe.
Generated by muteval.