HPC-B5 Training Throughput Benchmark
Device: cpu   PyTorch: 2.12.0
Warmup runs: 3   Timed runs: 5   Metric: best-of-5

n=1000
    K   batched(ms)   sequential(ms)   speedup
  K= 1          85.7             81.2      0.95x
  K= 2         164.7            186.5      1.13x
  K= 4         337.5            359.4      1.06x
  K= 8         683.1            758.2      1.11x
  K=16        1452.8           1562.0      1.07x

n=50000
    K   batched(ms)   sequential(ms)   speedup
  K= 1         968.1           1723.5      1.78x
  K= 2        1939.1           3261.6      1.68x
  K= 4        3493.4           6772.6      1.94x
  K= 8        7558.3          13422.8      1.78x
  K=16       14008.7          29186.0      2.08x

Key result (n=50K, best-of speedup over K sequential backward calls):
  K= 1: 1.78x
  K= 2: 1.68x
  K= 4: 1.94x
  K= 8: 1.78x
  K=16: 2.08x
