# HELP vllm:num_requests_running Number of requests currently running.
# TYPE vllm:num_requests_running gauge
vllm:num_requests_running{model_name="meta-llama/Llama-3.1-8B-Instruct"} 12.0
# TYPE vllm:num_requests_waiting gauge
vllm:num_requests_waiting{model_name="meta-llama/Llama-3.1-8B-Instruct"} 0.0
# TYPE vllm:kv_cache_usage_perc gauge
vllm:kv_cache_usage_perc{model_name="meta-llama/Llama-3.1-8B-Instruct"} 0.38
# TYPE vllm:prefix_cache_hits counter
vllm:prefix_cache_hits{model_name="meta-llama/Llama-3.1-8B-Instruct"} 610.0
# TYPE vllm:prefix_cache_queries counter
vllm:prefix_cache_queries{model_name="meta-llama/Llama-3.1-8B-Instruct"} 1000.0
# TYPE vllm:prompt_tokens_total counter
vllm:prompt_tokens_total{model_name="meta-llama/Llama-3.1-8B-Instruct"} 10210.0
# TYPE vllm:generation_tokens_total counter
vllm:generation_tokens_total{model_name="meta-llama/Llama-3.1-8B-Instruct"} 21632.0
# TYPE vllm:time_to_first_token_seconds histogram
vllm:time_to_first_token_seconds_sum{model_name="meta-llama/Llama-3.1-8B-Instruct"} 14.2
vllm:time_to_first_token_seconds_count{model_name="meta-llama/Llama-3.1-8B-Instruct"} 100.0
# TYPE vllm:inter_token_latency_seconds histogram
vllm:inter_token_latency_seconds_sum{model_name="meta-llama/Llama-3.1-8B-Instruct"} 3.1
vllm:inter_token_latency_seconds_count{model_name="meta-llama/Llama-3.1-8B-Instruct"} 100.0
# TYPE vllm:e2e_request_latency_seconds histogram
vllm:e2e_request_latency_seconds_bucket{le="0.1",model_name="meta-llama/Llama-3.1-8B-Instruct"} 5.0
vllm:e2e_request_latency_seconds_bucket{le="0.25",model_name="meta-llama/Llama-3.1-8B-Instruct"} 20.0
vllm:e2e_request_latency_seconds_bucket{le="0.5",model_name="meta-llama/Llama-3.1-8B-Instruct"} 80.0
vllm:e2e_request_latency_seconds_bucket{le="1.0",model_name="meta-llama/Llama-3.1-8B-Instruct"} 95.0
vllm:e2e_request_latency_seconds_bucket{le="+Inf",model_name="meta-llama/Llama-3.1-8B-Instruct"} 100.0
vllm:e2e_request_latency_seconds_sum{model_name="meta-llama/Llama-3.1-8B-Instruct"} 42.0
vllm:e2e_request_latency_seconds_count{model_name="meta-llama/Llama-3.1-8B-Instruct"} 100.0
# TYPE vllm:request_prompt_tokens histogram
vllm:request_prompt_tokens_sum{model_name="meta-llama/Llama-3.1-8B-Instruct"} 800000.0
vllm:request_prompt_tokens_count{model_name="meta-llama/Llama-3.1-8B-Instruct"} 100.0
# TYPE vllm:request_generation_tokens histogram
vllm:request_generation_tokens_sum{model_name="meta-llama/Llama-3.1-8B-Instruct"} 50000.0
vllm:request_generation_tokens_count{model_name="meta-llama/Llama-3.1-8B-Instruct"} 100.0
