# HELP python_gc_objects_collected_total Objects collected during gc
# TYPE python_gc_objects_collected_total counter
python_gc_objects_collected_total{generation="0"} 15282.0
python_gc_objects_collected_total{generation="1"} 2446.0
python_gc_objects_collected_total{generation="2"} 364.0
# HELP python_gc_objects_uncollectable_total Uncollectable objects found during GC
# TYPE python_gc_objects_uncollectable_total counter
python_gc_objects_uncollectable_total{generation="0"} 0.0
python_gc_objects_uncollectable_total{generation="1"} 0.0
python_gc_objects_uncollectable_total{generation="2"} 0.0
# HELP python_gc_collections_total Number of times this generation was collected
# TYPE python_gc_collections_total counter
python_gc_collections_total{generation="0"} 1510.0
python_gc_collections_total{generation="1"} 137.0
python_gc_collections_total{generation="2"} 10.0
# HELP python_info Python platform information
# TYPE python_info gauge
python_info{implementation="CPython",major="3",minor="12",patchlevel="13",version="3.12.13"} 1.0
# HELP process_virtual_memory_bytes Virtual memory size in bytes.
# TYPE process_virtual_memory_bytes gauge
process_virtual_memory_bytes 1.2011814912e+010
# HELP process_resident_memory_bytes Resident memory size in bytes.
# TYPE process_resident_memory_bytes gauge
process_resident_memory_bytes 5.72583936e+08
# HELP process_start_time_seconds Start time of the process since unix epoch in seconds.
# TYPE process_start_time_seconds gauge
process_start_time_seconds 1.78566465088e+09
# HELP process_cpu_seconds_total Total user and system CPU time spent in seconds.
# TYPE process_cpu_seconds_total counter
process_cpu_seconds_total 28.21
# HELP process_open_fds Number of open file descriptors.
# TYPE process_open_fds gauge
process_open_fds 50.0
# HELP process_max_fds Maximum number of open file descriptors.
# TYPE process_max_fds gauge
process_max_fds 65535.0
# HELP vllm:spec_decode_num_drafts_total Number of spec decoding drafts.
# TYPE vllm:spec_decode_num_drafts_total counter
vllm:spec_decode_num_drafts_total{engine="0",model_name="deepseek-v4-flash-0731"} 105.0
# HELP vllm:spec_decode_num_drafts_created Number of spec decoding drafts.
# TYPE vllm:spec_decode_num_drafts_created gauge
vllm:spec_decode_num_drafts_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650255819664e+09
# HELP vllm:spec_decode_num_draft_tokens_total Number of draft tokens.
# TYPE vllm:spec_decode_num_draft_tokens_total counter
vllm:spec_decode_num_draft_tokens_total{engine="0",model_name="deepseek-v4-flash-0731"} 525.0
# HELP vllm:spec_decode_num_draft_tokens_created Number of draft tokens.
# TYPE vllm:spec_decode_num_draft_tokens_created gauge
vllm:spec_decode_num_draft_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650255841796e+09
# HELP vllm:spec_decode_num_accepted_tokens_total Number of accepted tokens.
# TYPE vllm:spec_decode_num_accepted_tokens_total counter
vllm:spec_decode_num_accepted_tokens_total{engine="0",model_name="deepseek-v4-flash-0731"} 214.0
# HELP vllm:spec_decode_num_accepted_tokens_created Number of accepted tokens.
# TYPE vllm:spec_decode_num_accepted_tokens_created gauge
vllm:spec_decode_num_accepted_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650255841959e+09
# HELP vllm:spec_decode_num_accepted_tokens_per_pos_total Accepted tokens per draft position.
# TYPE vllm:spec_decode_num_accepted_tokens_per_pos_total counter
vllm:spec_decode_num_accepted_tokens_per_pos_total{engine="0",model_name="deepseek-v4-flash-0731",position="0"} 82.0
vllm:spec_decode_num_accepted_tokens_per_pos_total{engine="0",model_name="deepseek-v4-flash-0731",position="1"} 58.0
vllm:spec_decode_num_accepted_tokens_per_pos_total{engine="0",model_name="deepseek-v4-flash-0731",position="2"} 36.0
vllm:spec_decode_num_accepted_tokens_per_pos_total{engine="0",model_name="deepseek-v4-flash-0731",position="3"} 22.0
vllm:spec_decode_num_accepted_tokens_per_pos_total{engine="0",model_name="deepseek-v4-flash-0731",position="4"} 16.0
# HELP vllm:spec_decode_num_accepted_tokens_per_pos_created Accepted tokens per draft position.
# TYPE vllm:spec_decode_num_accepted_tokens_per_pos_created gauge
vllm:spec_decode_num_accepted_tokens_per_pos_created{engine="0",model_name="deepseek-v4-flash-0731",position="0"} 1.7856650255867708e+09
vllm:spec_decode_num_accepted_tokens_per_pos_created{engine="0",model_name="deepseek-v4-flash-0731",position="1"} 1.785665025586778e+09
vllm:spec_decode_num_accepted_tokens_per_pos_created{engine="0",model_name="deepseek-v4-flash-0731",position="2"} 1.7856650255869677e+09
vllm:spec_decode_num_accepted_tokens_per_pos_created{engine="0",model_name="deepseek-v4-flash-0731",position="3"} 1.785665025588567e+09
vllm:spec_decode_num_accepted_tokens_per_pos_created{engine="0",model_name="deepseek-v4-flash-0731",position="4"} 1.7856650255885746e+09
# HELP vllm:estimated_flops_per_gpu_total Estimated number of floating point operations per GPU (for Model Flops Utilization calculations).
# TYPE vllm:estimated_flops_per_gpu_total counter
vllm:estimated_flops_per_gpu_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:estimated_flops_per_gpu_created Estimated number of floating point operations per GPU (for Model Flops Utilization calculations).
# TYPE vllm:estimated_flops_per_gpu_created gauge
vllm:estimated_flops_per_gpu_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.785665025591385e+09
# HELP vllm:estimated_read_bytes_per_gpu_total Estimated number of bytes read from memory per GPU (for Model Flops Utilization calculations).
# TYPE vllm:estimated_read_bytes_per_gpu_total counter
vllm:estimated_read_bytes_per_gpu_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:estimated_read_bytes_per_gpu_created Estimated number of bytes read from memory per GPU (for Model Flops Utilization calculations).
# TYPE vllm:estimated_read_bytes_per_gpu_created gauge
vllm:estimated_read_bytes_per_gpu_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650255927753e+09
# HELP vllm:estimated_write_bytes_per_gpu_total Estimated number of bytes written to memory per GPU (for Model Flops Utilization calculations).
# TYPE vllm:estimated_write_bytes_per_gpu_total counter
vllm:estimated_write_bytes_per_gpu_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:estimated_write_bytes_per_gpu_created Estimated number of bytes written to memory per GPU (for Model Flops Utilization calculations).
# TYPE vllm:estimated_write_bytes_per_gpu_created gauge
vllm:estimated_write_bytes_per_gpu_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650255929794e+09
# HELP vllm:num_requests_running Number of requests in model execution batches.
# TYPE vllm:num_requests_running gauge
vllm:num_requests_running{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:num_requests_waiting Number of requests waiting to be processed.
# TYPE vllm:num_requests_waiting gauge
vllm:num_requests_waiting{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:num_requests_waiting_by_reason Number of waiting requests by reason. Reason labels: 'capacity' = waiting for scheduling capacity; 'deferred' = deferred by transient constraints (LoRA budget, KV transfer, blocked status). Sum of all reasons equals vllm:num_requests_waiting.
# TYPE vllm:num_requests_waiting_by_reason gauge
vllm:num_requests_waiting_by_reason{engine="0",model_name="deepseek-v4-flash-0731",reason="capacity"} 0.0
vllm:num_requests_waiting_by_reason{engine="0",model_name="deepseek-v4-flash-0731",reason="deferred"} 0.0
# HELP vllm:engine_sleep_state Engine sleep state; awake = 0 means engine is sleeping; awake = 1 means engine is awake; weights_offloaded = 1 means sleep level 1; discard_all = 1 means sleep level 2.
# TYPE vllm:engine_sleep_state gauge
vllm:engine_sleep_state{engine="0",model_name="deepseek-v4-flash-0731",sleep_state="awake"} 1.0
vllm:engine_sleep_state{engine="0",model_name="deepseek-v4-flash-0731",sleep_state="weights_offloaded"} 0.0
vllm:engine_sleep_state{engine="0",model_name="deepseek-v4-flash-0731",sleep_state="discard_all"} 0.0
# HELP vllm:kv_cache_usage_perc KV-cache usage. 1 means 100 percent usage.
# TYPE vllm:kv_cache_usage_perc gauge
vllm:kv_cache_usage_perc{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:prefix_cache_queries_total Prefix cache queries, in terms of number of queried tokens.
# TYPE vllm:prefix_cache_queries_total counter
vllm:prefix_cache_queries_total{engine="0",model_name="deepseek-v4-flash-0731"} 215382.0
# HELP vllm:prefix_cache_queries_created Prefix cache queries, in terms of number of queried tokens.
# TYPE vllm:prefix_cache_queries_created gauge
vllm:prefix_cache_queries_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256068685e+09
# HELP vllm:prefix_cache_hits_total Prefix cache hits, in terms of number of cached tokens.
# TYPE vllm:prefix_cache_hits_total counter
vllm:prefix_cache_hits_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:prefix_cache_hits_created Prefix cache hits, in terms of number of cached tokens.
# TYPE vllm:prefix_cache_hits_created gauge
vllm:prefix_cache_hits_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256481464e+09
# HELP vllm:external_prefix_cache_queries_total External prefix cache queries from KV connector cross-instance cache sharing, in terms of number of queried tokens.
# TYPE vllm:external_prefix_cache_queries_total counter
vllm:external_prefix_cache_queries_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:external_prefix_cache_queries_created External prefix cache queries from KV connector cross-instance cache sharing, in terms of number of queried tokens.
# TYPE vllm:external_prefix_cache_queries_created gauge
vllm:external_prefix_cache_queries_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.785665025648476e+09
# HELP vllm:external_prefix_cache_hits_total External prefix cache hits from KV connector cross-instance cache sharing, in terms of number of cached tokens.
# TYPE vllm:external_prefix_cache_hits_total counter
vllm:external_prefix_cache_hits_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:external_prefix_cache_hits_created External prefix cache hits from KV connector cross-instance cache sharing, in terms of number of cached tokens.
# TYPE vllm:external_prefix_cache_hits_created gauge
vllm:external_prefix_cache_hits_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256490626e+09
# HELP vllm:mm_cache_queries_total Multi-modal cache queries, in terms of number of queried items.
# TYPE vllm:mm_cache_queries_total counter
vllm:mm_cache_queries_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:mm_cache_queries_created Multi-modal cache queries, in terms of number of queried items.
# TYPE vllm:mm_cache_queries_created gauge
vllm:mm_cache_queries_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256493566e+09
# HELP vllm:mm_cache_hits_total Multi-modal cache hits, in terms of number of cached items.
# TYPE vllm:mm_cache_hits_total counter
vllm:mm_cache_hits_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:mm_cache_hits_created Multi-modal cache hits, in terms of number of cached items.
# TYPE vllm:mm_cache_hits_created gauge
vllm:mm_cache_hits_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.785665025652144e+09
# HELP vllm:num_preemptions_total Cumulative number of preemption from the engine.
# TYPE vllm:num_preemptions_total counter
vllm:num_preemptions_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:num_preemptions_created Cumulative number of preemption from the engine.
# TYPE vllm:num_preemptions_created gauge
vllm:num_preemptions_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256527426e+09
# HELP vllm:prompt_tokens_total Number of prefill tokens processed.
# TYPE vllm:prompt_tokens_total counter
vllm:prompt_tokens_total{engine="0",model_name="deepseek-v4-flash-0731"} 215382.0
# HELP vllm:prompt_tokens_created Number of prefill tokens processed.
# TYPE vllm:prompt_tokens_created gauge
vllm:prompt_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256535847e+09
# HELP vllm:prompt_tokens_by_source_total Number of prompt tokens by source.
# TYPE vllm:prompt_tokens_by_source_total counter
vllm:prompt_tokens_by_source_total{engine="0",model_name="deepseek-v4-flash-0731",source="local_compute"} 215382.0
vllm:prompt_tokens_by_source_total{engine="0",model_name="deepseek-v4-flash-0731",source="local_cache_hit"} 0.0
vllm:prompt_tokens_by_source_total{engine="0",model_name="deepseek-v4-flash-0731",source="external_kv_transfer"} 0.0
# HELP vllm:prompt_tokens_by_source_created Number of prompt tokens by source.
# TYPE vllm:prompt_tokens_by_source_created gauge
vllm:prompt_tokens_by_source_created{engine="0",model_name="deepseek-v4-flash-0731",source="local_compute"} 1.785665025654379e+09
vllm:prompt_tokens_by_source_created{engine="0",model_name="deepseek-v4-flash-0731",source="local_cache_hit"} 1.7856650256545765e+09
vllm:prompt_tokens_by_source_created{engine="0",model_name="deepseek-v4-flash-0731",source="external_kv_transfer"} 1.7856650256561425e+09
# HELP vllm:prompt_tokens_cached_total Number of cached prompt tokens (local + external).
# TYPE vllm:prompt_tokens_cached_total counter
vllm:prompt_tokens_cached_total{engine="0",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:prompt_tokens_cached_created Number of cached prompt tokens (local + external).
# TYPE vllm:prompt_tokens_cached_created gauge
vllm:prompt_tokens_cached_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.785665025656158e+09
# HELP vllm:generation_tokens_total Number of generation tokens processed.
# TYPE vllm:generation_tokens_total counter
vllm:generation_tokens_total{engine="0",model_name="deepseek-v4-flash-0731"} 318.0
# HELP vllm:generation_tokens_created Number of generation tokens processed.
# TYPE vllm:generation_tokens_created gauge
vllm:generation_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256561694e+09
# HELP vllm:request_success_total Count of successfully processed requests.
# TYPE vllm:request_success_total counter
vllm:request_success_total{engine="0",finished_reason="stop",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_success_total{engine="0",finished_reason="length",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_success_total{engine="0",finished_reason="abort",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_success_total{engine="0",finished_reason="error",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_success_total{engine="0",finished_reason="repetition",model_name="deepseek-v4-flash-0731"} 0.0
# HELP vllm:request_success_created Count of successfully processed requests.
# TYPE vllm:request_success_created gauge
vllm:request_success_created{engine="0",finished_reason="stop",model_name="deepseek-v4-flash-0731"} 1.7856650256632116e+09
vllm:request_success_created{engine="0",finished_reason="length",model_name="deepseek-v4-flash-0731"} 1.7856650256632297e+09
vllm:request_success_created{engine="0",finished_reason="abort",model_name="deepseek-v4-flash-0731"} 1.7856650256638725e+09
vllm:request_success_created{engine="0",finished_reason="error",model_name="deepseek-v4-flash-0731"} 1.785665025663885e+09
vllm:request_success_created{engine="0",finished_reason="repetition",model_name="deepseek-v4-flash-0731"} 1.7856650256640797e+09
# HELP vllm:request_prompt_tokens Number of prefill tokens processed.
# TYPE vllm:request_prompt_tokens histogram
vllm:request_prompt_tokens_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="100.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="200.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="500.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="1000.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prompt_tokens_bucket{engine="0",le="2000.0",model_name="deepseek-v4-flash-0731"} 2.0
vllm:request_prompt_tokens_bucket{engine="0",le="5000.0",model_name="deepseek-v4-flash-0731"} 2.0
vllm:request_prompt_tokens_bucket{engine="0",le="10000.0",model_name="deepseek-v4-flash-0731"} 4.0
vllm:request_prompt_tokens_bucket{engine="0",le="20000.0",model_name="deepseek-v4-flash-0731"} 4.0
vllm:request_prompt_tokens_bucket{engine="0",le="50000.0",model_name="deepseek-v4-flash-0731"} 6.0
vllm:request_prompt_tokens_bucket{engine="0",le="100000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prompt_tokens_bucket{engine="0",le="200000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prompt_tokens_bucket{engine="0",le="500000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prompt_tokens_bucket{engine="0",le="1e+06",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prompt_tokens_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prompt_tokens_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prompt_tokens_sum{engine="0",model_name="deepseek-v4-flash-0731"} 215382.0
# HELP vllm:request_prompt_tokens_created Number of prefill tokens processed.
# TYPE vllm:request_prompt_tokens_created gauge
vllm:request_prompt_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.785665025667357e+09
# HELP vllm:request_generation_tokens Number of generation tokens processed.
# TYPE vllm:request_generation_tokens histogram
vllm:request_generation_tokens_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_generation_tokens_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_generation_tokens_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_generation_tokens_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_generation_tokens_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_generation_tokens_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="100.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="200.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="500.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="1000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="2000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="5000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="10000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="20000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="50000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="100000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="200000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="500000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="1e+06",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_generation_tokens_sum{engine="0",model_name="deepseek-v4-flash-0731"} 318.0
# HELP vllm:request_generation_tokens_created Number of generation tokens processed.
# TYPE vllm:request_generation_tokens_created gauge
vllm:request_generation_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256773753e+09
# HELP vllm:iteration_tokens_total Histogram of number of tokens per engine_step.
# TYPE vllm:iteration_tokens_total histogram
vllm:iteration_tokens_total_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 25.0
vllm:iteration_tokens_total_bucket{engine="0",le="8.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:iteration_tokens_total_bucket{engine="0",le="16.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:iteration_tokens_total_bucket{engine="0",le="32.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:iteration_tokens_total_bucket{engine="0",le="64.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:iteration_tokens_total_bucket{engine="0",le="128.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:iteration_tokens_total_bucket{engine="0",le="256.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:iteration_tokens_total_bucket{engine="0",le="512.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:iteration_tokens_total_bucket{engine="0",le="1024.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:iteration_tokens_total_bucket{engine="0",le="2048.0",model_name="deepseek-v4-flash-0731"} 107.0
vllm:iteration_tokens_total_bucket{engine="0",le="4096.0",model_name="deepseek-v4-flash-0731"} 107.0
vllm:iteration_tokens_total_bucket{engine="0",le="8192.0",model_name="deepseek-v4-flash-0731"} 107.0
vllm:iteration_tokens_total_bucket{engine="0",le="16384.0",model_name="deepseek-v4-flash-0731"} 109.0
vllm:iteration_tokens_total_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 113.0
vllm:iteration_tokens_total_count{engine="0",model_name="deepseek-v4-flash-0731"} 113.0
vllm:iteration_tokens_total_sum{engine="0",model_name="deepseek-v4-flash-0731"} 215700.0
# HELP vllm:iteration_tokens_total_created Histogram of number of tokens per engine_step.
# TYPE vllm:iteration_tokens_total_created gauge
vllm:iteration_tokens_total_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256819928e+09
# HELP vllm:request_max_num_generation_tokens Histogram of maximum number of requested generation tokens.
# TYPE vllm:request_max_num_generation_tokens histogram
vllm:request_max_num_generation_tokens_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="100.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="200.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="500.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="1000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="2000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="5000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="10000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="20000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="50000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="100000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="200000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="500000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="1e+06",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_max_num_generation_tokens_sum{engine="0",model_name="deepseek-v4-flash-0731"} 318.0
# HELP vllm:request_max_num_generation_tokens_created Histogram of maximum number of requested generation tokens.
# TYPE vllm:request_max_num_generation_tokens_created gauge
vllm:request_max_num_generation_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256852744e+09
# HELP vllm:request_params_n Histogram of the n request parameter.
# TYPE vllm:request_params_n histogram
vllm:request_params_n_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_n_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_n_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_n_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_n_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_n_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_n_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_n_sum{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
# HELP vllm:request_params_n_created Histogram of the n request parameter.
# TYPE vllm:request_params_n_created gauge
vllm:request_params_n_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.785665025693242e+09
# HELP vllm:request_params_max_tokens Histogram of the max_tokens request parameter.
# TYPE vllm:request_params_max_tokens histogram
vllm:request_params_max_tokens_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_params_max_tokens_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_params_max_tokens_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_params_max_tokens_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_params_max_tokens_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_params_max_tokens_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_params_max_tokens_bucket{engine="0",le="100.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_params_max_tokens_bucket{engine="0",le="200.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_params_max_tokens_bucket{engine="0",le="500.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="1000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="2000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="5000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="10000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="20000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="50000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="100000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="200000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="500000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="1e+06",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_params_max_tokens_sum{engine="0",model_name="deepseek-v4-flash-0731"} 2048.0
# HELP vllm:request_params_max_tokens_created Histogram of the max_tokens request parameter.
# TYPE vllm:request_params_max_tokens_created gauge
vllm:request_params_max_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650256956298e+09
# HELP vllm:time_to_first_token_seconds Histogram of time to first token in seconds.
# TYPE vllm:time_to_first_token_seconds histogram
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.001",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.005",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.01",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.02",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.04",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.06",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.08",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.1",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.25",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.5",model_name="deepseek-v4-flash-0731"} 0.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="0.75",model_name="deepseek-v4-flash-0731"} 1.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 1.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="2.5",model_name="deepseek-v4-flash-0731"} 1.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 2.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="7.5",model_name="deepseek-v4-flash-0731"} 3.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 3.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 5.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="40.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="80.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="160.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="640.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="2560.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:time_to_first_token_seconds_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:time_to_first_token_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:time_to_first_token_seconds_sum{engine="0",model_name="deepseek-v4-flash-0731"} 131.72826194763184
# HELP vllm:time_to_first_token_seconds_created Histogram of time to first token in seconds.
# TYPE vllm:time_to_first_token_seconds_created gauge
vllm:time_to_first_token_seconds_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650257030196e+09
# HELP vllm:inter_token_latency_seconds Histogram of inter-token latency in seconds.
# TYPE vllm:inter_token_latency_seconds histogram
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.01",model_name="deepseek-v4-flash-0731"} 0.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.025",model_name="deepseek-v4-flash-0731"} 0.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.05",model_name="deepseek-v4-flash-0731"} 0.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.075",model_name="deepseek-v4-flash-0731"} 102.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.1",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.15",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.2",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.3",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.4",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.5",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="0.75",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="2.5",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="7.5",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="40.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="80.0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 105.0
vllm:inter_token_latency_seconds_sum{engine="0",model_name="deepseek-v4-flash-0731"} 6.675188861001516
# HELP vllm:inter_token_latency_seconds_created Histogram of inter-token latency in seconds.
# TYPE vllm:inter_token_latency_seconds_created gauge
vllm:inter_token_latency_seconds_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650257102842e+09
# HELP vllm:request_time_per_output_token_seconds Histogram of time_per_output_token_seconds per request.
# TYPE vllm:request_time_per_output_token_seconds histogram
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.01",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.025",model_name="deepseek-v4-flash-0731"} 7.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.05",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.075",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.1",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.15",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.2",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.3",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.4",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.5",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="0.75",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="2.5",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="7.5",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="40.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="80.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_time_per_output_token_seconds_sum{engine="0",model_name="deepseek-v4-flash-0731"} 0.1740870349641919
# HELP vllm:request_time_per_output_token_seconds_created Histogram of time_per_output_token_seconds per request.
# TYPE vllm:request_time_per_output_token_seconds_created gauge
vllm:request_time_per_output_token_seconds_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650257157922e+09
# HELP vllm:e2e_request_latency_seconds Histogram of e2e request latency in seconds.
# TYPE vllm:e2e_request_latency_seconds histogram
vllm:e2e_request_latency_seconds_bucket{engine="0",le="0.3",model_name="deepseek-v4-flash-0731"} 0.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="0.5",model_name="deepseek-v4-flash-0731"} 0.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="0.8",model_name="deepseek-v4-flash-0731"} 0.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="1.5",model_name="deepseek-v4-flash-0731"} 1.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 1.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="2.5",model_name="deepseek-v4-flash-0731"} 1.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 1.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 3.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="15.0",model_name="deepseek-v4-flash-0731"} 4.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 5.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="30.0",model_name="deepseek-v4-flash-0731"} 6.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="40.0",model_name="deepseek-v4-flash-0731"} 7.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="60.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="120.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="240.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="480.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="960.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="1920.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="7680.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:e2e_request_latency_seconds_sum{engine="0",model_name="deepseek-v4-flash-0731"} 138.39995908737183
# HELP vllm:e2e_request_latency_seconds_created Histogram of e2e request latency in seconds.
# TYPE vllm:e2e_request_latency_seconds_created gauge
vllm:e2e_request_latency_seconds_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.785665025719994e+09
# HELP vllm:request_queue_time_seconds Histogram of time spent in WAITING phase for request.
# TYPE vllm:request_queue_time_seconds histogram
vllm:request_queue_time_seconds_bucket{engine="0",le="0.3",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="0.5",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="0.8",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="1.5",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="2.5",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="15.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="30.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="40.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="60.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="120.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="240.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="480.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="960.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="1920.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="7680.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_queue_time_seconds_sum{engine="0",model_name="deepseek-v4-flash-0731"} 0.00012278400026843883
# HELP vllm:request_queue_time_seconds_created Histogram of time spent in WAITING phase for request.
# TYPE vllm:request_queue_time_seconds_created gauge
vllm:request_queue_time_seconds_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650257247903e+09
# HELP vllm:request_inference_time_seconds Histogram of time spent in RUNNING phase for request.
# TYPE vllm:request_inference_time_seconds histogram
vllm:request_inference_time_seconds_bucket{engine="0",le="0.3",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_inference_time_seconds_bucket{engine="0",le="0.5",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_inference_time_seconds_bucket{engine="0",le="0.8",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_inference_time_seconds_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_inference_time_seconds_bucket{engine="0",le="1.5",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_inference_time_seconds_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_inference_time_seconds_bucket{engine="0",le="2.5",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_inference_time_seconds_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_inference_time_seconds_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 3.0
vllm:request_inference_time_seconds_bucket{engine="0",le="15.0",model_name="deepseek-v4-flash-0731"} 4.0
vllm:request_inference_time_seconds_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 5.0
vllm:request_inference_time_seconds_bucket{engine="0",le="30.0",model_name="deepseek-v4-flash-0731"} 6.0
vllm:request_inference_time_seconds_bucket{engine="0",le="40.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="60.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="120.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="240.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="480.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="960.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="1920.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="7680.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_inference_time_seconds_sum{engine="0",model_name="deepseek-v4-flash-0731"} 137.93595615899903
# HELP vllm:request_inference_time_seconds_created Histogram of time spent in RUNNING phase for request.
# TYPE vllm:request_inference_time_seconds_created gauge
vllm:request_inference_time_seconds_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650257295911e+09
# HELP vllm:request_prefill_time_seconds Histogram of time spent in PREFILL phase for request.
# TYPE vllm:request_prefill_time_seconds histogram
vllm:request_prefill_time_seconds_bucket{engine="0",le="0.3",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="0.5",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="0.8",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="1.5",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="2.5",model_name="deepseek-v4-flash-0731"} 1.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 2.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 3.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="15.0",model_name="deepseek-v4-flash-0731"} 4.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 5.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="30.0",model_name="deepseek-v4-flash-0731"} 6.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="40.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="60.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="120.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="240.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="480.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="960.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="1920.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="7680.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_time_seconds_sum{engine="0",model_name="deepseek-v4-flash-0731"} 131.26076729799752
# HELP vllm:request_prefill_time_seconds_created Histogram of time spent in PREFILL phase for request.
# TYPE vllm:request_prefill_time_seconds_created gauge
vllm:request_prefill_time_seconds_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650257353077e+09
# HELP vllm:request_decode_time_seconds Histogram of time spent in DECODE phase for request.
# TYPE vllm:request_decode_time_seconds histogram
vllm:request_decode_time_seconds_bucket{engine="0",le="0.3",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_decode_time_seconds_bucket{engine="0",le="0.5",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_decode_time_seconds_bucket{engine="0",le="0.8",model_name="deepseek-v4-flash-0731"} 3.0
vllm:request_decode_time_seconds_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 7.0
vllm:request_decode_time_seconds_bucket{engine="0",le="1.5",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="2.5",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="15.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="30.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="40.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="60.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="120.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="240.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="480.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="960.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="1920.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="7680.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_decode_time_seconds_sum{engine="0",model_name="deepseek-v4-flash-0731"} 6.675188861001516
# HELP vllm:request_decode_time_seconds_created Histogram of time spent in DECODE phase for request.
# TYPE vllm:request_decode_time_seconds_created gauge
vllm:request_decode_time_seconds_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650257408843e+09
# HELP vllm:request_prefill_kv_computed_tokens Histogram of new KV tokens computed during prefill (excluding cached tokens).
# TYPE vllm:request_prefill_kv_computed_tokens histogram
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="1.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="2.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="5.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="10.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="20.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="50.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="100.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="200.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="500.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="1000.0",model_name="deepseek-v4-flash-0731"} 0.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="2000.0",model_name="deepseek-v4-flash-0731"} 2.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="5000.0",model_name="deepseek-v4-flash-0731"} 2.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="10000.0",model_name="deepseek-v4-flash-0731"} 4.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="20000.0",model_name="deepseek-v4-flash-0731"} 4.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="50000.0",model_name="deepseek-v4-flash-0731"} 6.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="100000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="200000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="500000.0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="1e+06",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_kv_computed_tokens_bucket{engine="0",le="+Inf",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_kv_computed_tokens_count{engine="0",model_name="deepseek-v4-flash-0731"} 8.0
vllm:request_prefill_kv_computed_tokens_sum{engine="0",model_name="deepseek-v4-flash-0731"} 215382.0
# HELP vllm:request_prefill_kv_computed_tokens_created Histogram of new KV tokens computed during prefill (excluding cached tokens).
# TYPE vllm:request_prefill_kv_computed_tokens_created gauge
vllm:request_prefill_kv_computed_tokens_created{engine="0",model_name="deepseek-v4-flash-0731"} 1.7856650257462053e+09
# HELP vllm:cache_config_info Information of the LLMEngine CacheConfig
# TYPE vllm:cache_config_info gauge
vllm:cache_config_info{_block_size_resolved="True",block_size="4",cache_dtype="fp8_ds_mla",calculate_kv_scales="False",enable_prefix_caching="True",engine="0",gpu_memory_utilization="0.8",hash_block_size="None",is_attention_free="False",kv_cache_dtype_skip_layers="[]",kv_cache_max_concurrency="1.0641851789045278",kv_cache_memory_bytes="None",kv_cache_size_tokens="1115879",kv_offloading_backend="native",kv_offloading_size="None",kv_sharing_fast_prefill="False",mamba_block_size="None",mamba_cache_dtype="auto",mamba_cache_mode="none",mamba_page_size_padded="None",mamba_ssm_cache_dtype="auto",num_cpu_blocks="None",num_gpu_blocks="12551",num_gpu_blocks_override="None",prefix_caching_hash_algo="sha256",skip_page_size_padded="None",sliding_window="128",user_specified_block_size="True",user_specified_mamba_block_size="False"} 1.0
# HELP http_requests_total Total number of requests by method, status and handler.
# TYPE http_requests_total counter
http_requests_total{handler="/v1/models",method="GET",status="2xx"} 7.0
http_requests_total{handler="/tokenize",method="POST",status="2xx"} 92.0
http_requests_total{handler="/v1/chat/completions",method="POST",status="2xx"} 8.0
http_requests_total{handler="none",method="HEAD",status="4xx"} 3.0
# HELP http_requests_created Total number of requests by method, status and handler.
# TYPE http_requests_created gauge
http_requests_created{handler="/v1/models",method="GET",status="2xx"} 1.785665243798697e+09
http_requests_created{handler="/tokenize",method="POST",status="2xx"} 1.7856652590880253e+09
http_requests_created{handler="/v1/chat/completions",method="POST",status="2xx"} 1.7856652656151576e+09
http_requests_created{handler="none",method="HEAD",status="4xx"} 1.7856681803242877e+09
# HELP http_request_size_bytes Content length of incoming requests by handler. Only value of header is respected. Otherwise ignored. No percentile calculated. 
# TYPE http_request_size_bytes summary
http_request_size_bytes_count{handler="/v1/models"} 7.0
http_request_size_bytes_sum{handler="/v1/models"} 0.0
http_request_size_bytes_count{handler="/tokenize"} 92.0
http_request_size_bytes_sum{handler="/tokenize"} 1.2337788e+07
http_request_size_bytes_count{handler="/v1/chat/completions"} 8.0
http_request_size_bytes_sum{handler="/v1/chat/completions"} 1.68359e+06
http_request_size_bytes_count{handler="none"} 3.0
http_request_size_bytes_sum{handler="none"} 0.0
# HELP http_request_size_bytes_created Content length of incoming requests by handler. Only value of header is respected. Otherwise ignored. No percentile calculated. 
# TYPE http_request_size_bytes_created gauge
http_request_size_bytes_created{handler="/v1/models"} 1.7856652437987125e+09
http_request_size_bytes_created{handler="/tokenize"} 1.7856652590880387e+09
http_request_size_bytes_created{handler="/v1/chat/completions"} 1.7856652656151862e+09
http_request_size_bytes_created{handler="none"} 1.785668180324301e+09
# HELP http_response_size_bytes Content length of outgoing responses by handler. Only value of header is respected. Otherwise ignored. No percentile calculated. 
# TYPE http_response_size_bytes summary
http_response_size_bytes_count{handler="/v1/models"} 7.0
http_response_size_bytes_sum{handler="/v1/models"} 3451.0
http_response_size_bytes_count{handler="/tokenize"} 92.0
http_response_size_bytes_sum{handler="/tokenize"} 8.424194e+06
http_response_size_bytes_count{handler="/v1/chat/completions"} 8.0
http_response_size_bytes_sum{handler="/v1/chat/completions"} 0.0
http_response_size_bytes_count{handler="none"} 3.0
http_response_size_bytes_sum{handler="none"} 66.0
# HELP http_response_size_bytes_created Content length of outgoing responses by handler. Only value of header is respected. Otherwise ignored. No percentile calculated. 
# TYPE http_response_size_bytes_created gauge
http_response_size_bytes_created{handler="/v1/models"} 1.7856652437987256e+09
http_response_size_bytes_created{handler="/tokenize"} 1.7856652590880497e+09
http_response_size_bytes_created{handler="/v1/chat/completions"} 1.7856652656152213e+09
http_response_size_bytes_created{handler="none"} 1.7856681803243115e+09
# HELP http_request_duration_highr_seconds Latency with many buckets but no API specific labels. Made for more accurate percentile calculations. 
# TYPE http_request_duration_highr_seconds histogram
http_request_duration_highr_seconds_bucket{le="0.01"} 62.0
http_request_duration_highr_seconds_bucket{le="0.025"} 75.0
http_request_duration_highr_seconds_bucket{le="0.05"} 90.0
http_request_duration_highr_seconds_bucket{le="0.075"} 97.0
http_request_duration_highr_seconds_bucket{le="0.1"} 98.0
http_request_duration_highr_seconds_bucket{le="0.25"} 101.0
http_request_duration_highr_seconds_bucket{le="0.5"} 102.0
http_request_duration_highr_seconds_bucket{le="0.75"} 102.0
http_request_duration_highr_seconds_bucket{le="1.0"} 102.0
http_request_duration_highr_seconds_bucket{le="1.5"} 103.0
http_request_duration_highr_seconds_bucket{le="2.0"} 103.0
http_request_duration_highr_seconds_bucket{le="2.5"} 103.0
http_request_duration_highr_seconds_bucket{le="3.0"} 103.0
http_request_duration_highr_seconds_bucket{le="3.5"} 103.0
http_request_duration_highr_seconds_bucket{le="4.0"} 103.0
http_request_duration_highr_seconds_bucket{le="4.5"} 103.0
http_request_duration_highr_seconds_bucket{le="5.0"} 103.0
http_request_duration_highr_seconds_bucket{le="7.5"} 105.0
http_request_duration_highr_seconds_bucket{le="10.0"} 105.0
http_request_duration_highr_seconds_bucket{le="30.0"} 108.0
http_request_duration_highr_seconds_bucket{le="60.0"} 110.0
http_request_duration_highr_seconds_bucket{le="+Inf"} 110.0
http_request_duration_highr_seconds_count 110.0
http_request_duration_highr_seconds_sum 140.54524832399693
# HELP http_request_duration_highr_seconds_created Latency with many buckets but no API specific labels. Made for more accurate percentile calculations. 
# TYPE http_request_duration_highr_seconds_created gauge
http_request_duration_highr_seconds_created 1.785665029206407e+09
# HELP http_request_duration_seconds Latency with only few buckets by handler. Made to be only used if aggregation by handler is important. 
# TYPE http_request_duration_seconds histogram
http_request_duration_seconds_bucket{handler="/v1/models",le="0.1",method="GET"} 7.0
http_request_duration_seconds_bucket{handler="/v1/models",le="0.5",method="GET"} 7.0
http_request_duration_seconds_bucket{handler="/v1/models",le="1.0",method="GET"} 7.0
http_request_duration_seconds_bucket{handler="/v1/models",le="+Inf",method="GET"} 7.0
http_request_duration_seconds_count{handler="/v1/models",method="GET"} 7.0
http_request_duration_seconds_sum{handler="/v1/models",method="GET"} 0.002811349000694463
http_request_duration_seconds_bucket{handler="/tokenize",le="0.1",method="POST"} 88.0
http_request_duration_seconds_bucket{handler="/tokenize",le="0.5",method="POST"} 92.0
http_request_duration_seconds_bucket{handler="/tokenize",le="1.0",method="POST"} 92.0
http_request_duration_seconds_bucket{handler="/tokenize",le="+Inf",method="POST"} 92.0
http_request_duration_seconds_count{handler="/tokenize",method="POST"} 92.0
http_request_duration_seconds_sum{handler="/tokenize",method="POST"} 2.11505346299964
http_request_duration_seconds_bucket{handler="/v1/chat/completions",le="0.1",method="POST"} 0.0
http_request_duration_seconds_bucket{handler="/v1/chat/completions",le="0.5",method="POST"} 0.0
http_request_duration_seconds_bucket{handler="/v1/chat/completions",le="1.0",method="POST"} 0.0
http_request_duration_seconds_bucket{handler="/v1/chat/completions",le="+Inf",method="POST"} 8.0
http_request_duration_seconds_count{handler="/v1/chat/completions",method="POST"} 8.0
http_request_duration_seconds_sum{handler="/v1/chat/completions",method="POST"} 138.4265730319985
http_request_duration_seconds_bucket{handler="none",le="0.1",method="HEAD"} 3.0
http_request_duration_seconds_bucket{handler="none",le="0.5",method="HEAD"} 3.0
http_request_duration_seconds_bucket{handler="none",le="1.0",method="HEAD"} 3.0
http_request_duration_seconds_bucket{handler="none",le="+Inf",method="HEAD"} 3.0
http_request_duration_seconds_count{handler="none",method="HEAD"} 3.0
http_request_duration_seconds_sum{handler="none",method="HEAD"} 0.0008104799981083488
# HELP http_request_duration_seconds_created Latency with only few buckets by handler. Made to be only used if aggregation by handler is important. 
# TYPE http_request_duration_seconds_created gauge
http_request_duration_seconds_created{handler="/v1/models",method="GET"} 1.7856652437987454e+09
http_request_duration_seconds_created{handler="/tokenize",method="POST"} 1.7856652590880678e+09
http_request_duration_seconds_created{handler="/v1/chat/completions",method="POST"} 1.785665265615263e+09
http_request_duration_seconds_created{handler="none",method="HEAD"} 1.7856681803243287e+09
# HELP vllm:tool_call_parser_invocations_total Total number of ToolParser invocations. Non-streaming increments once per choice; streaming increments once per delta.
# TYPE vllm:tool_call_parser_invocations_total counter
vllm:tool_call_parser_invocations_total{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="chat_completions"} 0.0
vllm:tool_call_parser_invocations_total{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="responses"} 0.0
vllm:tool_call_parser_invocations_total{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="other"} 0.0
vllm:tool_call_parser_invocations_total{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="chat_completions"} 113.0
vllm:tool_call_parser_invocations_total{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="responses"} 0.0
vllm:tool_call_parser_invocations_total{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="other"} 0.0
vllm:tool_call_parser_invocations_total{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="chat_completions"} 0.0
vllm:tool_call_parser_invocations_total{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="responses"} 0.0
vllm:tool_call_parser_invocations_total{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="other"} 0.0
vllm:tool_call_parser_invocations_total{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="chat_completions"} 0.0
vllm:tool_call_parser_invocations_total{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="responses"} 0.0
vllm:tool_call_parser_invocations_total{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="other"} 0.0
# HELP vllm:tool_call_parser_invocations_created Total number of ToolParser invocations. Non-streaming increments once per choice; streaming increments once per delta.
# TYPE vllm:tool_call_parser_invocations_created gauge
vllm:tool_call_parser_invocations_created{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="chat_completions"} 1.785665029224896e+09
vllm:tool_call_parser_invocations_created{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="responses"} 1.7856650292249095e+09
vllm:tool_call_parser_invocations_created{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="other"} 1.7856650292249177e+09
vllm:tool_call_parser_invocations_created{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="chat_completions"} 1.785665029225553e+09
vllm:tool_call_parser_invocations_created{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="responses"} 1.7856650292255995e+09
vllm:tool_call_parser_invocations_created{mode="streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="other"} 1.7856650292256114e+09
vllm:tool_call_parser_invocations_created{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="chat_completions"} 1.785665029225637e+09
vllm:tool_call_parser_invocations_created{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="responses"} 1.7856650292256458e+09
vllm:tool_call_parser_invocations_created{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="tool_call",request_type="other"} 1.785665029225657e+09
vllm:tool_call_parser_invocations_created{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="chat_completions"} 1.785665029225665e+09
vllm:tool_call_parser_invocations_created{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="responses"} 1.785665029226183e+09
vllm:tool_call_parser_invocations_created{mode="non_streaming",model_name="deepseek-v4-flash-0731",outcome="no_tool_call",request_type="other"} 1.785665029226212e+09
