== srv1 fix start Thu Aug 27 08:42:53 PM UTC 2026 ==
0.01.652.795 W llama_model_loader: tensor overrides to CPU are used with mmap enabled - consider using --load-mode none for better performance
0.08.680.068 E ggml_backend_cuda_buffer_type_alloc_buffer: allocating 5747.92 MiB on device 0: cudaMalloc failed: out of memory
0.08.680.079 E alloc_tensor_range: failed to allocate CUDA0 buffer of size 6027134464
0.08.759.645 E llama_model_load: error loading model: unable to allocate CUDA0 buffer
0.08.760.111 E srv  llama_server: exiting due to model loading error
srv1	30b-IQ3XXS np=8 ctx_slot=1024 c=8192 ncmoe=28	REFUSED	0.01.233.597 E srv  llama_server: exiting due to model loading error
srv1	30b-IQ3XXS np=32 ctx_slot=1024 c=32768 ncmoe=35	REFUSED	0.01.567.783 E srv  llama_server: exiting due to model loading error
srv1	gptoss-4b np=32 ctx_slot=1024 c=32768 ncmoe=0	CONFIG	real_ctx_slot=1024	vram=4172
srv1	gptoss-4b np=32 ctx_slot=1024 c=32768 ncmoe=0	n=1	agg=99.0	p50=4.80	truncated=0/1	wall=4.8
srv1	gptoss-4b np=32 ctx_slot=1024 c=32768 ncmoe=0	n=2	agg=36.5	p50=26.01	truncated=0/2	wall=26.0
srv1	gptoss-4b np=32 ctx_slot=1024 c=32768 ncmoe=0	n=4	agg=182.7	p50=10.40	truncated=0/4	wall=10.4
srv1	gptoss-4b np=32 ctx_slot=1024 c=32768 ncmoe=0	n=8	agg=204.4	p50=18.58	truncated=0/8	wall=18.6
srv1	gptoss-4b np=32 ctx_slot=1024 c=32768 ncmoe=0	n=16	agg=198.7	p50=38.22	truncated=0/16	wall=38.2
srv1	gptoss-4b np=32 ctx_slot=1024 c=32768 ncmoe=0	n=32	agg=215.3	p50=70.60	truncated=0/32	wall=70.6
srv1	q3-8b-Q4 np=16 ctx_slot=1024 c=16384 ncmoe=0	REFUSED	0.05.589.809 E srv  llama_server: exiting due to model loading error
srv1	q3-8b-Q4 np=32 ctx_slot=1024 c=32768 ncmoe=0	REFUSED	0.01.279.864 E srv  llama_server: exiting due to model loading error
srv1	mxfp4-20b np=8 ctx_slot=1024 c=8192 ncmoe=0	REFUSED	0.06.882.707 E srv  llama_server: exiting due to model loading error
srv1	mxfp4-20b np=32 ctx_slot=1024 c=32768 ncmoe=0	REFUSED	0.01.795.189 E srv  llama_server: exiting due to model loading error
== srv1 fix done Thu Aug 27 08:49:14 PM UTC 2026 ==
== srv1 gap start Thu Aug 27 08:46:34 PM UTC 2026 ==
== srv1 gap start Thu Aug 27 08:47:29 PM UTC 2026 ==
srv1	30b-IQ3XXS-kvu np=32 ctx_slot=1024 c=32768 ncmoe=48	CONFIG	real_ctx_slot=32768	vram=4134
srv1	30b-IQ3XXS-kvu np=32 ctx_slot=1024 c=32768 ncmoe=48	n=1	agg=17.8	p50=26.68	truncated=0/1	wall=26.7
srv1	30b-IQ3XXS-kvu np=32 ctx_slot=1024 c=32768 ncmoe=48	n=2	agg=19.3	p50=49.16	truncated=0/2	wall=49.2
srv1	30b-IQ3XXS-kvu np=32 ctx_slot=1024 c=32768 ncmoe=48	n=4	agg=17.9	p50=105.97	truncated=0/4	wall=106.0
srv1	30b-IQ3XXS-kvu np=32 ctx_slot=1024 c=32768 ncmoe=48	n=8	agg=21.3	p50=178.79	truncated=0/8	wall=178.8
srv1	30b-IQ3XXS-kvu np=32 ctx_slot=1024 c=32768 ncmoe=48	n=16	agg=21.1	p50=360.35	truncated=0/16	wall=360.4
srv1	30b-IQ3XXS-kvu np=32 ctx_slot=1024 c=32768 ncmoe=48	n=32	agg=41.5	p50=366.22	truncated=0/32	wall=366.2
srv1	14b-Q4-kvu np=8 ctx_slot=1024 c=8192 ncmoe=0	REFUSED	0.08.638.160 E srv  llama_server: exiting due to model loading error
srv1	32b-Q4-kvu np=8 ctx_slot=1024 c=8192 ncmoe=0	REFUSED	0.11.874.476 E srv  llama_server: exiting due to model loading error
srv1	32b-Q4-kvu np=16 ctx_slot=1024 c=16384 ncmoe=0	REFUSED	0.01.144.886 E srv  llama_server: exiting due to model loading error
== srv1 gap done Thu Aug 27 09:11:32 PM UTC 2026 ==
