All requests submitted at once — engine queues them, processes B=1 at a time. E2E includes queue wait.
| Engine (B=1) | req/s | tok/s | E2E p50 | E2E p99 |
|---|---|---|---|---|
| liteinfer | 1.69base | 70.06base | 11956 msbase | 18913 msbase |
| liteinfer-kvcache | 1.771.04x | 70.611.01x | 10480 ms1.14x | 18114 ms1.04x |
| vllm | 2.891.71x | 180.132.57x | 5786 ms2.07x | 11042 ms1.71x |
Sequential, no queue — each request sent only after previous finishes. Pure per-request engine latency.
| Engine (B=1) | TTFT p50 | TTFT p99 | E2E p50 | tok/s |
|---|---|---|---|---|
| liteinfer | 14 msbase | 16 msbase | 1726 msbase | 71.67base |
| liteinfer-kvcache | 15 ms0.89x | 17 ms0.90x | 1541 ms1.12x | 72.091.01x |
| vllm | 26 ms0.53x | 31 ms0.50x | 694 ms2.49x | 182.122.54x |