pping-lang

healthy engine
currently serving

vLLM GPU Count BF16 Peak Mem BW
TTFT p99
ms
TTFT p99 SLA ms
TPOT p99 SLA ms
E2E p99 SLA ms
TTFT p99
ms / SLA ms
TPOT p99
ms / SLA ms
E2E p99
ms / SLA ms

·
ms
p50
p95
p99
ms
p50
p95
p99
tok/s
tok/s
KV cache
%

%
%
%
%
CUDA padding
%

Compute roof Memory roof

Compute roof Memory roof

TTFT p99 ≤ ms TPOT p99 ≤ ms E2E p99 ≤ ms

SLA · TTFT p99 ≤ ms · TPOT p99 ≤ ms · E2E p99 ≤ ms / min
1observe
2hypothesize
3act
4measure
5decide