HPC-B5 Training Throughput Benchmark
Device: cuda   PyTorch: 2.5.1+cu121
Warmup runs: 3   Timed runs: 5   Metric: best-of-5

n=1000
    K   batched(ms)   sequential(ms)   speedup
  K= 1          16.5            284.4     17.22x
  K= 2         405.1            623.2      1.54x
  K= 4         389.6            393.2      1.01x
  K= 8         726.4            781.7      1.08x
  K=16        1500.0           1534.8      1.02x

n=50000
    K   batched(ms)   sequential(ms)   speedup
  K= 1         134.6            241.6      1.79x
  K= 2         207.8            457.0      2.20x
  K= 4         363.6            903.0      2.48x
  K= 8         669.3           1911.6      2.86x
  K=16        1304.0           3915.4      3.00x

Key result (n=50K, best-of speedup over K sequential backward calls):
  K= 1: 1.79x
  K= 2: 2.20x
  K= 4: 2.48x
  K= 8: 2.86x
  K=16: 3.00x
