# vLLM v1-style names: gpu_cache_usage_perc as percent, TPOT via time_per_output_token.
vllm:num_requests_running{model_name="google/gemma-3-270m"} 1.0
vllm:num_requests_waiting{model_name="google/gemma-3-270m"} 0.0
vllm:gpu_cache_usage_perc{model_name="google/gemma-3-270m"} 38.0
vllm:gpu_prefix_cache_hit_rate{model_name="google/gemma-3-270m"} 12.0
vllm:prompt_tokens_total{model_name="google/gemma-3-270m"} 640.0
vllm:generation_tokens_total{model_name="google/gemma-3-270m"} 1200.0
vllm:time_to_first_token_seconds_sum{model_name="google/gemma-3-270m"} 0.80
vllm:time_to_first_token_seconds_count{model_name="google/gemma-3-270m"} 10.0
vllm:time_per_output_token_seconds_sum{model_name="google/gemma-3-270m"} 0.10
vllm:time_per_output_token_seconds_count{model_name="google/gemma-3-270m"} 10.0
vllm:e2e_request_latency_seconds_bucket{le="0.25",model_name="google/gemma-3-270m"} 2.0
vllm:e2e_request_latency_seconds_bucket{le="0.5",model_name="google/gemma-3-270m"} 8.0
vllm:e2e_request_latency_seconds_bucket{le="+Inf",model_name="google/gemma-3-270m"} 10.0
vllm:e2e_request_latency_seconds_sum{model_name="google/gemma-3-270m"} 4.0
vllm:e2e_request_latency_seconds_count{model_name="google/gemma-3-270m"} 10.0
vllm:request_prompt_tokens_sum{model_name="google/gemma-3-270m"} 640.0
vllm:request_prompt_tokens_count{model_name="google/gemma-3-270m"} 10.0
vllm:request_generation_tokens_sum{model_name="google/gemma-3-270m"} 1200.0
vllm:request_generation_tokens_count{model_name="google/gemma-3-270m"} 10.0
vllm:avg_prompt_throughput_toks_per_s{model_name="google/gemma-3-270m"} 64.0
vllm:avg_generation_throughput_toks_per_s{model_name="google/gemma-3-270m"} 120.0
