# Waiting queue + high KV — the case users see when the GPU is packed.
vllm:num_requests_running{model_name="Qwen/Qwen3-32B"} 8.0
vllm:num_requests_waiting{model_name="Qwen/Qwen3-32B"} 14.0
vllm:kv_cache_usage_perc{model_name="Qwen/Qwen3-32B"} 0.91
vllm:prefix_cache_hits{model_name="Qwen/Qwen3-32B"} 40.0
vllm:prefix_cache_queries{model_name="Qwen/Qwen3-32B"} 400.0
vllm:prompt_tokens_total{model_name="Qwen/Qwen3-32B"} 50000.0
vllm:generation_tokens_total{model_name="Qwen/Qwen3-32B"} 80000.0
vllm:time_to_first_token_seconds_sum{model_name="Qwen/Qwen3-32B"} 40.0
vllm:time_to_first_token_seconds_count{model_name="Qwen/Qwen3-32B"} 20.0
vllm:inter_token_latency_seconds_sum{model_name="Qwen/Qwen3-32B"} 2.0
vllm:inter_token_latency_seconds_count{model_name="Qwen/Qwen3-32B"} 20.0
vllm:e2e_request_latency_seconds_bucket{le="1.0",model_name="Qwen/Qwen3-32B"} 4.0
vllm:e2e_request_latency_seconds_bucket{le="+Inf",model_name="Qwen/Qwen3-32B"} 20.0
vllm:e2e_request_latency_seconds_sum{model_name="Qwen/Qwen3-32B"} 36.0
vllm:e2e_request_latency_seconds_count{model_name="Qwen/Qwen3-32B"} 20.0
vllm:avg_prompt_throughput_toks_per_s{model_name="Qwen/Qwen3-32B"} 800.0
vllm:avg_generation_throughput_toks_per_s{model_name="Qwen/Qwen3-32B"} 1600.0
