[MOUNT@a7b0bcb1-arbi/bf16] === arbi bf16 | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=n/a(TKV_BITS) | TP=1 gmu=0.99 mbt=2048 | mode=mount code=a7b0bcb1 img=registry.arbi.work/arbi-serve:latest@sha256:ff14ef5890ec46424d149d6088b2e1b08294b30571f0a24ad2b847a9ae0aadff | max_running_req=? ===
[MOUNT@a7b0bcb1-arbi/bf16] [c=1] Request throughput (req/s):              0.33      
[MOUNT@a7b0bcb1-arbi/bf16] [c=1] Output token throughput (tok/s):         333.30    
[MOUNT@a7b0bcb1-arbi/bf16] [c=1] Peak output token throughput (tok/s):    372.00    
[MOUNT@a7b0bcb1-arbi/bf16] [c=1] Median TTFT (ms):                        306.92    
[MOUNT@a7b0bcb1-arbi/bf16] [c=1] P95 TTFT (ms):                           360.54    
[MOUNT@a7b0bcb1-arbi/bf16] [c=1] Mean TPOT (ms):                          2.70      
[MOUNT@a7b0bcb1-arbi/bf16] [c=1] Median TPOT (ms):                        2.70      
[MOUNT@a7b0bcb1-arbi/bf16] [c=1] P95 TPOT (ms):                           2.70      
[rig] GPU 0: lock HELD @ 2700MHz across 6 working samples (peak host load1 8.52, peak mem 22818 MiB, no throttle).
[rig] host=dev-gpu load1=5.25/32c | gpu0: sm=2700MHz util=100% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@a7b0bcb1-arbi/bf16] === arbi bf16 | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=n/a(TKV_BITS) | TP=1 gmu=0.99 mbt=2048 | mode=mount code=a7b0bcb1 img=registry.arbi.work/arbi-serve:latest@sha256:ff14ef5890ec46424d149d6088b2e1b08294b30571f0a24ad2b847a9ae0aadff | max_running_req=? ===
[MOUNT@a7b0bcb1-arbi/bf16] [c=16] Request throughput (req/s):              1.35      
[MOUNT@a7b0bcb1-arbi/bf16] [c=16] Output token throughput (tok/s):         1380.76   
[MOUNT@a7b0bcb1-arbi/bf16] [c=16] Peak output token throughput (tok/s):    2142.00   
[MOUNT@a7b0bcb1-arbi/bf16] [c=16] Median TTFT (ms):                        635.39    
[MOUNT@a7b0bcb1-arbi/bf16] [c=16] P95 TTFT (ms):                           3945.82   
[MOUNT@a7b0bcb1-arbi/bf16] [c=16] Mean TPOT (ms):                          10.34     
[MOUNT@a7b0bcb1-arbi/bf16] [c=16] Median TPOT (ms):                        10.80     
[MOUNT@a7b0bcb1-arbi/bf16] [c=16] P95 TPOT (ms):                           11.00     
[rig] GPU 0: lock HELD @ 2700MHz across 7 working samples (peak host load1 3.96, peak mem 23574 MiB, no throttle).
[rig] host=dev-gpu load1=1.42/32c | gpu0: sm=2700MHz util=0% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@a7b0bcb1-arbi/bf16] === arbi bf16 | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=n/a(TKV_BITS) | TP=1 gmu=0.99 mbt=8192 | mode=mount code=a7b0bcb1 img=registry.arbi.work/arbi-serve:latest@sha256:ff14ef5890ec46424d149d6088b2e1b08294b30571f0a24ad2b847a9ae0aadff | max_running_req=? ===
[MOUNT@a7b0bcb1-arbi/bf16] [c=64] Request throughput (req/s):              1.73      
[MOUNT@a7b0bcb1-arbi/bf16] [c=64] Output token throughput (tok/s):         1770.97   
[MOUNT@a7b0bcb1-arbi/bf16] [c=64] Peak output token throughput (tok/s):    3009.00   
[MOUNT@a7b0bcb1-arbi/bf16] [c=64] Median TTFT (ms):                        938.65    
[MOUNT@a7b0bcb1-arbi/bf16] [c=64] P95 TTFT (ms):                           13702.92  
[MOUNT@a7b0bcb1-arbi/bf16] [c=64] Mean TPOT (ms):                          32.73     
[MOUNT@a7b0bcb1-arbi/bf16] [c=64] Median TPOT (ms):                        34.84     
[MOUNT@a7b0bcb1-arbi/bf16] [c=64] P95 TPOT (ms):                           35.32     
[rig] GPU 0: lock HELD @ 2700MHz across 21 working samples (peak host load1 1.84, peak mem 23140 MiB, no throttle).
[rig] host=dev-gpu load1=1.77/32c | gpu0: sm=2700MHz util=88% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@a7b0bcb1-arbi/tkv] === arbi tkv | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=4(TKV_BITS) | TP=1 gmu=0.99 mbt=2048 | mode=mount code=a7b0bcb1 img=registry.arbi.work/arbi-serve:latest@sha256:ff14ef5890ec46424d149d6088b2e1b08294b30571f0a24ad2b847a9ae0aadff | max_running_req=? ===
[MOUNT@a7b0bcb1-arbi/tkv] [c=1] Request throughput (req/s):              0.33      
[MOUNT@a7b0bcb1-arbi/tkv] [c=1] Output token throughput (tok/s):         338.69    
[MOUNT@a7b0bcb1-arbi/tkv] [c=1] Peak output token throughput (tok/s):    380.00    
[MOUNT@a7b0bcb1-arbi/tkv] [c=1] Median TTFT (ms):                        303.97    
[MOUNT@a7b0bcb1-arbi/tkv] [c=1] P95 TTFT (ms):                           359.30    
[MOUNT@a7b0bcb1-arbi/tkv] [c=1] Mean TPOT (ms):                          2.65      
[MOUNT@a7b0bcb1-arbi/tkv] [c=1] Median TPOT (ms):                        2.66      
[MOUNT@a7b0bcb1-arbi/tkv] [c=1] P95 TPOT (ms):                           2.66      
[rig] GPU 0: lock HELD @ 2700MHz across 7 working samples (peak host load1 3.85, peak mem 22620 MiB, no throttle).
[rig] host=dev-gpu load1=2.67/32c | gpu0: sm=2700MHz util=100% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@a7b0bcb1-arbi/tkv] === arbi tkv | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=4(TKV_BITS) | TP=1 gmu=0.99 mbt=2048 | mode=mount code=a7b0bcb1 img=registry.arbi.work/arbi-serve:latest@sha256:ff14ef5890ec46424d149d6088b2e1b08294b30571f0a24ad2b847a9ae0aadff | max_running_req=? ===
[MOUNT@a7b0bcb1-arbi/tkv] [c=16] Request throughput (req/s):              1.56      
[MOUNT@a7b0bcb1-arbi/tkv] [c=16] Output token throughput (tok/s):         1596.56   
[MOUNT@a7b0bcb1-arbi/tkv] [c=16] Peak output token throughput (tok/s):    2957.00   
[MOUNT@a7b0bcb1-arbi/tkv] [c=16] Median TTFT (ms):                        773.54    
[MOUNT@a7b0bcb1-arbi/tkv] [c=16] P95 TTFT (ms):                           4200.77   
[MOUNT@a7b0bcb1-arbi/tkv] [c=16] Mean TPOT (ms):                          8.64      
[MOUNT@a7b0bcb1-arbi/tkv] [c=16] Median TPOT (ms):                        9.14      
[MOUNT@a7b0bcb1-arbi/tkv] [c=16] P95 TPOT (ms):                           9.38      
[rig] GPU 0: lock HELD @ 2700MHz across 7 working samples (peak host load1 2.06, peak mem 23340 MiB, no throttle).
[rig] host=dev-gpu load1=1.30/32c | gpu0: sm=2700MHz util=0% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@a7b0bcb1-arbi/tkv] === arbi tkv | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=4(TKV_BITS) | TP=1 gmu=0.99 mbt=8192 | mode=mount code=a7b0bcb1 img=registry.arbi.work/arbi-serve:latest@sha256:ff14ef5890ec46424d149d6088b2e1b08294b30571f0a24ad2b847a9ae0aadff | max_running_req=? ===
[MOUNT@a7b0bcb1-arbi/tkv] [c=64] Request throughput (req/s):              2.15      
[MOUNT@a7b0bcb1-arbi/tkv] [c=64] Output token throughput (tok/s):         2198.83   
[MOUNT@a7b0bcb1-arbi/tkv] [c=64] Peak output token throughput (tok/s):    4862.00   
[MOUNT@a7b0bcb1-arbi/tkv] [c=64] Median TTFT (ms):                        1163.94   
[MOUNT@a7b0bcb1-arbi/tkv] [c=64] P95 TTFT (ms):                           14306.63  
[MOUNT@a7b0bcb1-arbi/tkv] [c=64] Mean TPOT (ms):                          25.49     
[MOUNT@a7b0bcb1-arbi/tkv] [c=64] Median TPOT (ms):                        27.72     
[MOUNT@a7b0bcb1-arbi/tkv] [c=64] P95 TPOT (ms):                           28.30     
RIG-PREFLIGHT FATAL: GPU 0 left the 2700+/-60MHz band in 4/18 WORKING samples (min 2610MHz) — the clock MOVED mid-run; DISCARD.
[rig] host=dev-gpu load1=1.49/32c | gpu0: sm=2700MHz util=100% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@3da4a3c5-vllm/bf16] === vllm bf16 | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=n/a(TKV_BITS) | TP=1 gmu=0.95 mbt=2048 | mode=mount code=3da4a3c5 img=registry.arbi.work/vllm-tkv:latest@sha256:895c53bbedc4f4ab9dafa3e1608adfe73b16b2602f842210defc3fe288d57121 | max_running_req=? ===
[MOUNT@3da4a3c5-vllm/bf16] [c=1] Request throughput (req/s):              0.34      
[MOUNT@3da4a3c5-vllm/bf16] [c=1] Output token throughput (tok/s):         343.97    
[MOUNT@3da4a3c5-vllm/bf16] [c=1] Peak output token throughput (tok/s):    376.00    
[MOUNT@3da4a3c5-vllm/bf16] [c=1] Median TTFT (ms):                        260.18    
[MOUNT@3da4a3c5-vllm/bf16] [c=1] P95 TTFT (ms):                           265.53    
[MOUNT@3da4a3c5-vllm/bf16] [c=1] Mean TPOT (ms):                          2.65      
[MOUNT@3da4a3c5-vllm/bf16] [c=1] Median TPOT (ms):                        2.65      
[MOUNT@3da4a3c5-vllm/bf16] [c=1] P95 TPOT (ms):                           2.66      
[rig] GPU 0: lock HELD @ 2700MHz across 9 working samples (peak host load1 3.01, peak mem 20692 MiB, no throttle).
[rig] host=dev-gpu load1=1.82/32c | gpu0: sm=2700MHz util=85% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@3da4a3c5-vllm/bf16] === vllm bf16 | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=n/a(TKV_BITS) | TP=1 gmu=0.95 mbt=2048 | mode=mount code=3da4a3c5 img=registry.arbi.work/vllm-tkv:latest@sha256:895c53bbedc4f4ab9dafa3e1608adfe73b16b2602f842210defc3fe288d57121 | max_running_req=? ===
[MOUNT@3da4a3c5-vllm/bf16] [c=16] Request throughput (req/s):              1.46      
[MOUNT@3da4a3c5-vllm/bf16] [c=16] Output token throughput (tok/s):         1497.03   
[MOUNT@3da4a3c5-vllm/bf16] [c=16] Peak output token throughput (tok/s):    2304.00   
[MOUNT@3da4a3c5-vllm/bf16] [c=16] Median TTFT (ms):                        598.61    
[MOUNT@3da4a3c5-vllm/bf16] [c=16] P95 TTFT (ms):                           3479.77   
[MOUNT@3da4a3c5-vllm/bf16] [c=16] Mean TPOT (ms):                          9.53      
[MOUNT@3da4a3c5-vllm/bf16] [c=16] Median TPOT (ms):                        10.00     
[MOUNT@3da4a3c5-vllm/bf16] [c=16] P95 TPOT (ms):                           10.07     
[rig] GPU 0: lock HELD @ 2700MHz across 8 working samples (peak host load1 1.39, peak mem 20692 MiB, SW power-cap in 3 samples — clock held).
[rig] host=dev-gpu load1=1.25/32c | gpu0: sm=2700MHz util=71% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@3da4a3c5-vllm/bf16] === vllm bf16 | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=n/a(TKV_BITS) | TP=1 gmu=0.95 mbt=8192 | mode=mount code=3da4a3c5 img=registry.arbi.work/vllm-tkv:latest@sha256:895c53bbedc4f4ab9dafa3e1608adfe73b16b2602f842210defc3fe288d57121 | max_running_req=? ===
[MOUNT@3da4a3c5-vllm/bf16] [c=64] Request throughput (req/s):              1.69      
[MOUNT@3da4a3c5-vllm/bf16] [c=64] Output token throughput (tok/s):         1733.58   
[MOUNT@3da4a3c5-vllm/bf16] [c=64] Peak output token throughput (tok/s):    3300.00   
[MOUNT@3da4a3c5-vllm/bf16] [c=64] Median TTFT (ms):                        2336.40   
[MOUNT@3da4a3c5-vllm/bf16] [c=64] P95 TTFT (ms):                           19764.53  
[MOUNT@3da4a3c5-vllm/bf16] [c=64] Mean TPOT (ms):                          29.89     
[MOUNT@3da4a3c5-vllm/bf16] [c=64] Median TPOT (ms):                        32.67     
[MOUNT@3da4a3c5-vllm/bf16] [c=64] P95 TPOT (ms):                           33.01     
RIG-PREFLIGHT FATAL: GPU 0 left the 2700+/-60MHz band in 5/27 WORKING samples (min 2595MHz) — the clock MOVED mid-run; DISCARD.
[rig] host=dev-gpu load1=0.57/32c | gpu0: sm=2700MHz util=100% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@3da4a3c5-vllm/tkv] === vllm tkv | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=4(TKV_BITS) | TP=1 gmu=0.95 mbt=2048 | mode=mount code=3da4a3c5 img=registry.arbi.work/vllm-tkv:latest@sha256:895c53bbedc4f4ab9dafa3e1608adfe73b16b2602f842210defc3fe288d57121 | max_running_req=? ===
[MOUNT@3da4a3c5-vllm/tkv] [c=1] Request throughput (req/s):              0.34      
[MOUNT@3da4a3c5-vllm/tkv] [c=1] Output token throughput (tok/s):         350.62    
[MOUNT@3da4a3c5-vllm/tkv] [c=1] Peak output token throughput (tok/s):    386.00    
[MOUNT@3da4a3c5-vllm/tkv] [c=1] Median TTFT (ms):                        268.14    
[MOUNT@3da4a3c5-vllm/tkv] [c=1] P95 TTFT (ms):                           287.40    
[MOUNT@3da4a3c5-vllm/tkv] [c=1] Mean TPOT (ms):                          2.59      
[MOUNT@3da4a3c5-vllm/tkv] [c=1] Median TPOT (ms):                        2.59      
[MOUNT@3da4a3c5-vllm/tkv] [c=1] P95 TPOT (ms):                           2.59      
[rig] GPU 0: lock HELD @ 2700MHz across 5 working samples (peak host load1 1.83, peak mem 20784 MiB, SW power-cap in 1 samples — clock held).
[rig] host=dev-gpu load1=1.30/32c | gpu0: sm=2700MHz util=0% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@3da4a3c5-vllm/tkv] === vllm tkv | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=4(TKV_BITS) | TP=1 gmu=0.95 mbt=2048 | mode=mount code=3da4a3c5 img=registry.arbi.work/vllm-tkv:latest@sha256:895c53bbedc4f4ab9dafa3e1608adfe73b16b2602f842210defc3fe288d57121 | max_running_req=? ===
[MOUNT@3da4a3c5-vllm/tkv] [c=16] Request throughput (req/s):              1.82      
[MOUNT@3da4a3c5-vllm/tkv] [c=16] Output token throughput (tok/s):         1867.63   
[MOUNT@3da4a3c5-vllm/tkv] [c=16] Peak output token throughput (tok/s):    3152.00   
[MOUNT@3da4a3c5-vllm/tkv] [c=16] Median TTFT (ms):                        598.98    
[MOUNT@3da4a3c5-vllm/tkv] [c=16] P95 TTFT (ms):                           3357.19   
[MOUNT@3da4a3c5-vllm/tkv] [c=16] Mean TPOT (ms):                          7.45      
[MOUNT@3da4a3c5-vllm/tkv] [c=16] Median TPOT (ms):                        7.86      
[MOUNT@3da4a3c5-vllm/tkv] [c=16] P95 TPOT (ms):                           8.02      
[rig] GPU 0: lock HELD @ 2700MHz across 10 working samples (peak host load1 2.75, peak mem 20786 MiB, no throttle).
[rig] host=dev-gpu load1=1.46/32c | gpu0: sm=2700MHz util=57% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
[MOUNT@3da4a3c5-vllm/tkv] === vllm tkv | /models/Qwen3.5-0.8B | ISL=16384 OSL=1024 | lock=2700MHz bits=4(TKV_BITS) | TP=1 gmu=0.95 mbt=8192 | mode=mount code=3da4a3c5 img=registry.arbi.work/vllm-tkv:latest@sha256:895c53bbedc4f4ab9dafa3e1608adfe73b16b2602f842210defc3fe288d57121 | max_running_req=? ===
[MOUNT@3da4a3c5-vllm/tkv] [c=64] Request throughput (req/s):              2.34      
[MOUNT@3da4a3c5-vllm/tkv] [c=64] Output token throughput (tok/s):         2396.23   
[MOUNT@3da4a3c5-vllm/tkv] [c=64] Peak output token throughput (tok/s):    5184.00   
[MOUNT@3da4a3c5-vllm/tkv] [c=64] Median TTFT (ms):                        1234.66   
[MOUNT@3da4a3c5-vllm/tkv] [c=64] P95 TTFT (ms):                           13045.47  
[MOUNT@3da4a3c5-vllm/tkv] [c=64] Mean TPOT (ms):                          23.35     
[MOUNT@3da4a3c5-vllm/tkv] [c=64] Median TPOT (ms):                        25.44     
[MOUNT@3da4a3c5-vllm/tkv] [c=64] P95 TPOT (ms):                           25.58     
RIG-PREFLIGHT FATAL: GPU 0 left the 2700+/-60MHz band in 7/20 WORKING samples (min 2595MHz) — the clock MOVED mid-run; DISCARD.
[rig] host=dev-gpu load1=1.14/32c | gpu0: sm=2700MHz util=0% mem=1MiB throttle=0x0000000000000000 pcie=gen4x16
