# HELP vllm:num_requests_running Number of requests in model execution batches.
# TYPE vllm:num_requests_running gauge
vllm:num_requests_running{engine="0",model_name="deepseek-v4-flash-0731"} 2.0
vllm:num_requests_waiting{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:kv_cache_usage_perc{engine="0",model_name="deepseek-v4-flash-0731"} 0.262
vllm:prefix_cache_queries_total{engine="0",model_name="deepseek-v4-flash-0731"} 215382.0
vllm:prefix_cache_hits_total{engine="0",model_name="deepseek-v4-flash-0731"} 186572.0
vllm:prompt_tokens_total{engine="0",model_name="deepseek-v4-flash-0731"} 215382.0
vllm:generation_tokens_total{engine="0",model_name="deepseek-v4-flash-0731"} 318.0
vllm:e2e_request_latency_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 1832.0
vllm:cache_config_info{block_size="4",cache_dtype="fp8_ds_mla",enable_prefix_caching="True",engine="0",gpu_memory_utilization="0.8",kv_cache_size_tokens="1115879"} 1.0
