# HELP vllm:request_success_total Count of successfully processed requests.
# TYPE vllm:request_success_total counter
vllm:request_success_total{finished_reason="stop",model_name="meta-llama/Llama-3.1-8B-Instruct"} 1840.0
vllm:request_success_total{finished_reason="length",model_name="meta-llama/Llama-3.1-8B-Instruct"} 160.0
# HELP vllm:request_prompt_tokens Number of prefill tokens processed.
# TYPE vllm:request_prompt_tokens histogram
vllm:request_prompt_tokens_bucket{le="128.0",model_name="m"} 200.0
vllm:request_prompt_tokens_bucket{le="256.0",model_name="m"} 600.0
vllm:request_prompt_tokens_bucket{le="512.0",model_name="m"} 1400.0
vllm:request_prompt_tokens_bucket{le="1024.0",model_name="m"} 1900.0
vllm:request_prompt_tokens_bucket{le="+Inf",model_name="m"} 2000.0
vllm:request_prompt_tokens_sum{model_name="m"} 906000.0
vllm:request_prompt_tokens_count{model_name="m"} 2000.0
# HELP vllm:request_generation_tokens Number of generation tokens processed.
# TYPE vllm:request_generation_tokens histogram
vllm:request_generation_tokens_bucket{le="64.0",model_name="m"} 500.0
vllm:request_generation_tokens_bucket{le="128.0",model_name="m"} 1200.0
vllm:request_generation_tokens_bucket{le="256.0",model_name="m"} 1800.0
vllm:request_generation_tokens_bucket{le="+Inf",model_name="m"} 2000.0
vllm:request_generation_tokens_sum{model_name="m"} 288000.0
vllm:request_generation_tokens_count{model_name="m"} 2000.0
# HELP vllm:e2e_request_latency_seconds End to end request latency.
# TYPE vllm:e2e_request_latency_seconds histogram
vllm:e2e_request_latency_seconds_bucket{le="1.0",model_name="m"} 300.0
vllm:e2e_request_latency_seconds_bucket{le="2.5",model_name="m"} 1100.0
vllm:e2e_request_latency_seconds_bucket{le="5.0",model_name="m"} 1700.0
vllm:e2e_request_latency_seconds_bucket{le="10.0",model_name="m"} 1950.0
vllm:e2e_request_latency_seconds_bucket{le="+Inf",model_name="m"} 2000.0
vllm:e2e_request_latency_seconds_sum{model_name="m"} 6400.0
vllm:e2e_request_latency_seconds_count{model_name="m"} 2000.0
# HELP vllm:num_requests_running Number of requests currently running on GPU.
# TYPE vllm:num_requests_running gauge
vllm:num_requests_running{model_name="m"} 14.0
# HELP vllm:num_requests_waiting Number of requests waiting to be processed.
# TYPE vllm:num_requests_waiting gauge
vllm:num_requests_waiting{model_name="m"} 3.0
# HELP vllm:prefix_cache_queries Prefix cache queries, in terms of number of queried tokens.
# TYPE vllm:prefix_cache_queries counter
vllm:prefix_cache_queries{model_name="m"} 906000.0
# HELP vllm:prefix_cache_hits Prefix cache hits, in terms of number of cached tokens.
# TYPE vllm:prefix_cache_hits counter
vllm:prefix_cache_hits{model_name="m"} 371460.0
