== full-slice run, all
  A cautious                         n=919  catches bad  17.9%   keeps correct  92.5% [90.3%, 94.3%]   precision  76.6% [73.6%, 79.4%]   keep-all 74.4%
  C split (introduced + no-defect)   n=919  catches bad  62.6%   keeps correct  57.2% [53.4%, 60.8%]   precision  81.6% [77.9%, 84.8%]   keep-all 74.4%
== full-slice run, in-sample
  A cautious                         n=105  catches bad  20.8%   keeps correct  94.2% [84.4%, 98.0%]   precision  53.8% [43.7%, 63.7%]   keep-all 49.5%
  C split (introduced + no-defect)   n=105  catches bad  62.3%   keeps correct  65.4% [51.8%, 76.8%]   precision  63.0% [49.6%, 74.6%]   keep-all 49.5%
== full-slice run, out-of-sample
  A cautious                         n=814  catches bad  17.0%   keeps correct  92.4% [90.1%, 94.2%]   precision  79.5% [76.4%, 82.2%]   keep-all 77.6%
  C split (introduced + no-defect)   n=814  catches bad  62.6%   keeps correct  56.5% [52.6%, 60.3%]   precision  84.0% [80.2%, 87.2%]   keep-all 77.6%

  out of sample, C − A in precision +4.5 pp, paired bootstrap [+2.0, +7.1]

== the pilot's 105 (balanced 53/52; precision also reweighted to the slice's 74.1%)
  A cautious (pilot)                 catches bad  15.1%   keeps correct 100.0%   precision@74.1% 77.2%   (published counts)
  C split (pilot)                    catches bad  60.4%   keeps correct  61.5%   precision@74.1% 81.7%   (published counts)
  B neutral                          n=105  catches bad  18.9%   keeps correct  96.2% [87.0%, 98.9%]   precision  53.8% [43.7%, 63.5%]   keep-all 49.5%  precision@74.1% 77.3%
  E introduced-only                  n=105  catches bad  35.8%   keeps correct  73.1% [59.7%, 83.2%]   precision  52.8% [41.4%, 63.9%]   keep-all 49.5%  precision@74.1% 76.6%
  D no-defect-only                   n=105  catches bad  54.7%   keeps correct  61.5% [48.0%, 73.5%]   precision  57.1% [44.1%, 69.2%]   keep-all 49.5%  precision@74.1% 79.6%
