All requests submitted at once — engine queues them, processes B=1 at a time. E2E includes queue wait.
| Engine | B | req/s | tok/s | E2E p50 | E2E p99 |
|---|---|---|---|---|---|
| liteinfer | 1 | 1.81base | 75.02base | 11192.5 msbase | 17661.7 msbase |
| liteinfer-kvcache | 1 | 1.871.03x | 74.801.00x | 9865.2 ms1.13x | 17099.8 ms1.03x |
| liteinfer-b4 | 4 | 4.422.44x | 181.652.42x | 4095.7 ms2.73x | 7233.5 ms2.44x |
| vllm | 1 | 2.891.60x | 180.452.41x | 5785.3 ms1.93x | 11023.2 ms1.60x |
| vllm-b4 | 4 | 10.675.89x | 649.588.66x | 1656.0 ms6.76x | 2963.3 ms5.96x |
Sequential, no queue — each request sent only after previous finishes. Pure per-request engine latency.
| Engine | B | TTFT p50 | TTFT p99 | E2E p50 | tok/s |
|---|---|---|---|---|---|
| liteinfer | 1 | 13.4 msbase | 13.7 msbase | 1653.9 msbase | 74.83base |
| liteinfer-kvcache | 1 | 14.6 ms0.92x | 16.3 ms0.84x | 1489.6 ms1.11x | 75.131.00x |
| vllm | 1 | 25.5 ms0.53x | 27.2 ms0.51x | 692.8 ms2.39x | 182.552.44x |