arm M read from run-M.json (Amendment 3)
rows 30 · replicas 2 · US$ 0.1924 · stopped: {'M': 'stop rule: 8/10 transport errors'} · fixtures b2f9e29a5fd3

[D] openrouter/deepseek/deepseek-v4-flash-0731 via DeepInfra  turns 60, ran 60, halted 0, transport failures 0
  incomplete reviews               0/60 = 0.0% [0.0%, 6.0%]  causes {}
  recall, a hit shown (±3)       34/40 = 85.0% [70.9%, 92.9%]
    finder recall, before verifier 35/40 = 87.5% [73.9%, 94.5%]
    incomplete counted as a miss   34/40 = 85.0% [70.9%, 92.9%]
    replica 1: 18/20 shown, 18/20 located
    replica 2: 16/20 shown, 17/20 located
  clean diffs: 9 shown of 10 anchored over 10, 10 shown of 11 anchored over 10; per 10 diffs after the verifier 9.5 (before 10.5)
  cost US$ 0.0612, per review US$ 0.00102 · tokens 182828/279201 · cache read 55040 · finder median 32.2s

[L] openrouter/openai/gpt-6-luna via OpenAI  turns 60, ran 60, halted 0, transport failures 0
  incomplete reviews               0/60 = 0.0% [0.0%, 6.0%]  causes {}
  recall, a hit shown (±3)       39/40 = 97.5% [87.1%, 99.6%]
    finder recall, before verifier 39/40 = 97.5% [87.1%, 99.6%]
    incomplete counted as a miss   39/40 = 97.5% [87.1%, 99.6%]
    replica 1: 20/20 shown, 20/20 located
    replica 2: 19/20 shown, 19/20 located
  clean diffs: 9 shown of 9 anchored over 10, 8 shown of 8 anchored over 10; per 10 diffs after the verifier 8.5 (before 8.5)
  cost US$ 0.0604, per review US$ 0.001007 · tokens 185741/83659 · cache read 54597 · finder median 10.4s

[Q] openrouter/qwen/qwen3.7-flash via Alibaba  turns 60, ran 60, halted 0, transport failures 0
  incomplete reviews               3/60 = 5.0% [1.7%, 13.7%]  causes {'ceiling': 2, 'unreadable': 1}
  recall, a hit shown (±3)       27/38 = 71.1% [55.2%, 83.0%]
    finder recall, before verifier 28/38 = 73.7% [58.0%, 85.0%]
    incomplete counted as a miss   27/40 = 67.5% [52.0%, 79.9%]
    replica 1: 14/19 shown, 14/19 located
    replica 2: 13/19 shown, 14/19 located
  clean diffs: 9 shown of 12 anchored over 9, 16 shown of 16 anchored over 10; per 10 diffs after the verifier 13.0 (before 14.67)
  cost US$ 0.0702, per review US$ 0.00117 · tokens 207975/491829 · cache read 34304 · finder median 68.2s

[M] openrouter/mistralai/mistral-small-3.2-24b-instruct via Parasail  turns 60, ran 10, halted 50, transport failures 8
  incomplete reviews               0/2 = 0.0% [0.0%, 65.8%]  causes {}
  recall, a hit shown (±3)       1/2 = 50.0% [9.5%, 90.5%]
    finder recall, before verifier 1/2 = 50.0% [9.5%, 90.5%]
    incomplete counted as a miss   1/2 = 50.0% [9.5%, 90.5%]
    replica 1: 0/0 shown, 0/0 located
    replica 2: 1/2 shown, 1/2 located
  clean diffs: ; per 10 diffs after the verifier None (before None)
  cost US$ 0.0006, per review US$ 6.3e-05 · tokens 5269/524 · cache read 368 · finder median 4.7s

POSITIVE CONTROL D replica 1 finder recall 18/20 against S15's 17/20: reproduced
FLOOR replica disagreement on a shown hit, seeded items with every replica done:
  D: 6/20
  L: 1/20
  Q: 2/18
  M: 0/0
PAIRED against D, replica 1, a shown hit (reported, not decided on):
  L on 20: only D 0, only L 2, exact McNemar p = 0.5
  Q on 19: only D 3, only Q 0, exact McNemar p = 0.25
  M on 0: only D 0, only M 0, exact McNemar p = 1

DECISION (frozen rule)
  L: qualifies, US$ 0.00101 per review
  Q: does not qualify (recall 71.1% < D's 85.0% - 10 pp; clean findings 13.0 > D's 9.5 + 2)
  M: does not qualify (not measured: stop rule: 8/10 transport errors)
  chosen: L (openrouter/openai/gpt-6-luna), the cheapest qualifying
