LICENSE
MANIFEST.in
README.md
README_CN.md
pyproject.toml
requirements.txt
setup.py
cpp_engine/CMakeLists.txt
cpp_engine/README.md
cpp_engine/backends/api/device_runtime.hpp
cpp_engine/backends/ascend/collective/tp_comm.cpp
cpp_engine/backends/ascend/kernels/aclnn_common.hpp
cpp_engine/backends/ascend/kernels/aclnn_ops.cpp
cpp_engine/backends/ascend/kernels/qwen_argmax_f32.cpp
cpp_engine/backends/ascend/kernels/qwen_ascend_kernel_common.hpp
cpp_engine/backends/ascend/kernels/qwen_ascend_ops_launch.cpp
cpp_engine/backends/ascend/kernels/qwen_attention_f16.cpp
cpp_engine/backends/ascend/kernels/qwen_gated_delta_f16.cpp
cpp_engine/backends/ascend/kernels/qwen_linear_f16.cpp
cpp_engine/backends/ascend/runtime/device_runtime_ascend.cpp
cpp_engine/backends/cuda/collective/tp_comm.cpp
cpp_engine/backends/cuda/kernels/bf16_ops.cu
cpp_engine/backends/cuda/kernels/cuda_ops.cu
cpp_engine/backends/cuda/kernels/flashmemory_ops.cu
cpp_engine/backends/cuda/kernels/fp4_ops.cu
cpp_engine/backends/cuda/kernels/fp8_ops.cu
cpp_engine/backends/cuda/kernels/iq1_grid.inc
cpp_engine/backends/cuda/kernels/iq1_ops.cu
cpp_engine/backends/cuda/kernels/q2_ops.cu
cpp_engine/backends/cuda/kernels/quant_gemm.cu
cpp_engine/backends/cuda/kernels/qwen_attention_ops.cu
cpp_engine/backends/cuda/kernels/qwen_dflash2_ops.cu
cpp_engine/backends/cuda/kernels/qwen_dspark_ops.cu
cpp_engine/backends/cuda/kernels/qwen_fp8_ops.cu
cpp_engine/backends/cuda/kernels/qwen_gdn_flashqla.cu
cpp_engine/backends/cuda/kernels/qwen_gqa_optimized.cu
cpp_engine/backends/cuda/kernels/qwen_half_ops.cu
cpp_engine/backends/cuda/kernels/qwen_int8_per_token_head_ops.cu
cpp_engine/backends/cuda/kernels/qwen_nvfp4_ops.cu
cpp_engine/backends/cuda/kernels/qwen_turboquant_ops.cu
cpp_engine/backends/cuda/kernels/rmsnorm_rope.cu
cpp_engine/backends/cuda/kernels/sampler_ops.cu
cpp_engine/backends/cuda/runtime/device_runtime_cuda.cpp
cpp_engine/cmake/CheckLayering.cmake
cpp_engine/core/block_pool.cpp
cpp_engine/core/block_table.cpp
cpp_engine/core/cmd_channel.cpp
cpp_engine/core/gguf_reader.cpp
cpp_engine/core/json_constraint.cpp
cpp_engine/core/json_lite.cpp
cpp_engine/core/metrics.cpp
cpp_engine/core/metrics.hpp
cpp_engine/core/model_config.cpp
cpp_engine/core/model_registry.cpp
cpp_engine/core/python_sidecar.cpp
cpp_engine/core/qwen_config.cpp
cpp_engine/core/qwen_weight_map.cpp
cpp_engine/core/safetensors_model.cpp
cpp_engine/core/safetensors_reader.cpp
cpp_engine/core/sampler.cpp
cpp_engine/core/tensor.cpp
cpp_engine/core/token_constraint.cpp
cpp_engine/core/tokenizer.cpp
cpp_engine/core/weight_source.cpp
cpp_engine/engine/backend_unimplemented_ascend.cpp
cpp_engine/engine/batch_scheduler.cpp
cpp_engine/engine/deepseek_v4_engine.cpp
cpp_engine/engine/dspark_engine.cpp
cpp_engine/engine/engine_registry_builtin.cpp
cpp_engine/engine/main.cpp
cpp_engine/engine/openai_server.cpp
cpp_engine/engine/persistent_engine_adapter.cpp
cpp_engine/engine/qwen_dflash2.cpp
cpp_engine/engine/qwen_dspark.cpp
cpp_engine/engine/qwen_engine.cpp
cpp_engine/engine/qwen_layer_components.hpp
cpp_engine/engine/qwen_layer_components.inl
cpp_engine/engine/qwen_target_head.cpp
cpp_engine/engine/qwen_weights.cpp
cpp_engine/include/batch_scheduler.hpp
cpp_engine/include/block_pool.hpp
cpp_engine/include/block_table.hpp
cpp_engine/include/cmd_channel.hpp
cpp_engine/include/cuda_ops.hpp
cpp_engine/include/deepseek_v4_engine.hpp
cpp_engine/include/dspark.hpp
cpp_engine/include/flashmemory_ops.hpp
cpp_engine/include/gguf_reader.hpp
cpp_engine/include/inference_engine.hpp
cpp_engine/include/json_constraint.hpp
cpp_engine/include/json_lite.hpp
cpp_engine/include/model_config.hpp
cpp_engine/include/model_registry.hpp
cpp_engine/include/openai_server.hpp
cpp_engine/include/persistent_engine.hpp
cpp_engine/include/persistent_engine_adapter.hpp
cpp_engine/include/python_sidecar.hpp
cpp_engine/include/qwen_ascend_ops.hpp
cpp_engine/include/qwen_config.hpp
cpp_engine/include/qwen_cuda_ops.hpp
cpp_engine/include/qwen_dflash2.hpp
cpp_engine/include/qwen_dspark.hpp
cpp_engine/include/qwen_engine.hpp
cpp_engine/include/qwen_ops.hpp
cpp_engine/include/qwen_target_head.hpp
cpp_engine/include/qwen_weights.hpp
cpp_engine/include/safetensors_model.hpp
cpp_engine/include/safetensors_reader.hpp
cpp_engine/include/sampler.hpp
cpp_engine/include/sampler_ops.hpp
cpp_engine/include/tensor.hpp
cpp_engine/include/token_constraint.hpp
cpp_engine/include/tokenizer.hpp
cpp_engine/include/tp_comm.hpp
cpp_engine/include/weight_source.hpp
cpp_engine/python/bindings.cpp
cpp_engine/third_party/httplib.cpp
cpp_engine/third_party/httplib.h
pocketllm/__init__.py
pocketllm/__main__.py
pocketllm/cli.py
pocketllm/engine.py
pocketllm/supervisor.py
pocketllm.egg-info/PKG-INFO
pocketllm.egg-info/SOURCES.txt
pocketllm.egg-info/dependency_links.txt
pocketllm.egg-info/entry_points.txt
pocketllm.egg-info/requires.txt
pocketllm.egg-info/top_level.txt
pocketllm/api/__init__.py
pocketllm/api/backend.py
pocketllm/api/errors.py
pocketllm/api/types.py
pocketllm/backends/__init__.py
pocketllm/backends/base.py
pocketllm/backends/cpp_backend.py
pocketllm/backends/factory.py
pocketllm/backends/torch_backend.py
pocketllm/protocol/__init__.py
pocketllm/protocol/chat.py
pocketllm/protocol/prompt.py
pocketllm/protocol/requests.py
pocketllm/server/__init__.py
pocketllm/server/metrics.py
pocketllm/server/openai.py
src/__init__.py
src/cli/__init__.py
src/cli/convert_checkpoint.py
src/cli/generate.py
src/cli/generate_gguf.py
src/cli/generate_glm.py
src/cli/inspect_gguf.py
src/cli/make_routed_source_gguf.py
src/cli/merge_imatrix.py
src/components/gguf/__init__.py
src/components/gguf/quantized_ops.py
src/components/gguf/tp_logits.py
src/components/moe/__init__.py
src/components/moe/capability.py
src/components/moe/cpu_backend.py
src/components/moe/gpu_prefill_backend.py
src/components/moe/ipc.py
src/components/moe/placement.py
src/components/moe/registry.py
src/components/moe/shared_weights.py
src/components/moe/spec.py
src/csrc/cuda_kernel.cpp
src/csrc/cuda_kernel_impl.cu
src/csrc/deepseek_cpu_moe_ext.cpp
src/csrc/dot_microbench.cpp
src/csrc/fused_decode_gqa_attention.cu
src/csrc/gguf_mma.h
src/csrc/minimax_gqa_kernel.cu
src/csrc/minimax_rope_kernel.cu
src/csrc/moe_dispatch_cuda_ext.cpp
src/csrc/moe_dispatch_cuda_kernel.cu
src/csrc/qwen4_exp_gated_delta.cu
src/csrc/qwen4_exp_hyper_connection.cu
src/csrc/qwen4_exp_moe.cu
src/csrc/qwen4_exp_qsa.cu
src/csrc/llama_mmq/common_shim.cuh
src/csrc/llama_mmq/ggml-common.h
src/csrc/llama_mmq/gguf_mma_wrapper.cu
src/csrc/llama_mmq/mma.cuh
src/csrc/llama_mmq/mmq.cuh
src/csrc/llama_mmq/vecdotq.cuh
src/encoding/__init__.py
src/encoding/deepseek_v4.py
src/encoding/gguf_tokenizer.py
src/encoding/glm_dsa.py
src/encoding/minimax_m2.py
src/kernels/__init__.py
src/kernels/cuda_loader.py
src/kernels/int8_per_token_head_triton.py
src/kernels/int8_triton_wrapper.py
src/kernels/moe_dispatch_loader.py
src/kernels/ops.py
src/kernels/tq4nc_quantizer.py
src/loader/__init__.py
src/loader/safetensors.py
src/loader/gguf/__init__.py
src/loader/gguf/bundle.py
src/loader/gguf/imatrix.py
src/loader/gguf/iq1_grid.py
src/loader/gguf/prewarm.py
src/loader/gguf/quant_types.py
src/loader/gguf/quantized_loader.py
src/loader/gguf/quantized_tensor.py
src/loader/gguf/reader.py
src/loader/gguf/tensor_reader.py
src/loader/mappings/deepseek_v4.py
src/loader/mappings/glm_dsa.py
src/loader/mappings/minimax_m2.py
src/models/__init__.py
src/models/deepseek_v4/__init__.py
src/models/deepseek_v4/dspark.py
src/models/deepseek_v4/dspark_gate.py
src/models/deepseek_v4/dspark_loop.py
src/models/deepseek_v4/generation.py
src/models/deepseek_v4/loader.py
src/models/deepseek_v4/moe_server.py
src/models/deepseek_v4/partition.py
src/models/deepseek_v4/runtime.py
src/models/deepseek_v4/spec.py
src/models/glm_dsa/__init__.py
src/models/glm_dsa/architecture.py
src/models/glm_dsa/gguf_model.py
src/models/glm_dsa/spec.py
src/models/minimax_m2/__init__.py
src/models/minimax_m2/architecture.py
src/models/minimax_m2/gguf_model.py
src/models/minimax_m2/moe_planning.py
src/models/minimax_m2/moe_runtime.py
src/models/minimax_m2/spec.py
src/models/qwen4_exp/__init__.py
src/models/qwen4_exp/attention.py
src/models/qwen4_exp/builder.py
src/models/qwen4_exp/config.py
src/models/qwen4_exp/layers.py
src/models/qwen4_exp/model.py
src/models/qwen4_exp/moe.py
src/models/qwen4_exp/profiler.py
src/models/qwen4_exp/quant.py
src/models/qwen4_exp/runtime.py
src/models/qwen4_exp/weights.py
src/runtime/__init__.py
src/runtime/generation.py
src/runtime/pd_scheduler.py
src/runtime/prefix_snapshot.py
src/server/__init__.py
src/server/cpp_sidecar.py
src/server/engine.py
src/server/openai.py
tests/test_backend_contract.py
tests/test_backend_selection.py
tests/test_cli.py
tests/test_compressor_step_order.py
tests/test_cpp_backend.py
tests/test_cpp_backend_batching.py
tests/test_cpp_backend_serial_ttft.py
tests/test_cpp_backend_tp.py
tests/test_cpp_backend_worker.py
tests/test_cpp_binding_smoke.py
tests/test_cpp_scheduler_streaming.py
tests/test_cpp_sidecar.py
tests/test_cpu_fp4_arena_fallback.py
tests/test_cpu_fp4_raw_moe.py
tests/test_deepseek_v4_model_namespace.py
tests/test_dspark_attention_parity.py
tests/test_dspark_gate.py
tests/test_dspark_gate_replay.py
tests/test_dspark_head_parity.py
tests/test_dspark_moe_parity.py
tests/test_dspark_predraft_gate.py
tests/test_encoding_deepseek_v4.py
tests/test_encoding_glm_dsa.py
tests/test_encoding_minimax_m2.py
tests/test_factory_tp_supervision_reuse.py
tests/test_fused_attn_prefuse.py
tests/test_fused_decode_gqa_real.py
tests/test_gguf_bundle.py
tests/test_gguf_imatrix.py
tests/test_gguf_iq1m_reader.py
tests/test_gguf_prewarm.py
tests/test_gguf_q2_precision.py
tests/test_gguf_quantized_ops_cuda.py
tests/test_gguf_tokenizer_pre.py
tests/test_glm_dsa_fused_rmsnorm.py
tests/test_glm_dsa_iq2xs_iq3xxs_dp4a.py
tests/test_glm_dsa_quant_cuda.py
tests/test_glm_dsa_resident_experts.py
tests/test_glm_dsa_spec.py
tests/test_glm_dsa_tp_routed.py
tests/test_hc_cuda.py
tests/test_inspect_gguf_specs.py
tests/test_install_smoke.py
tests/test_int8_gemm_imma.py
tests/test_minimax_decode_reduce.py
tests/test_minimax_fused_rope.py
tests/test_minimax_gqa_kernel.py
tests/test_minimax_iq2xxs_w2_dp4a.py
tests/test_minimax_m2_gguf_runtime.py
tests/test_minimax_m2_moe_runtime.py
tests/test_minimax_m2_spec.py
tests/test_moe_kernel_determinism.py
tests/test_moe_model_registry.py
tests/test_moe_multi_token_fp4.py
tests/test_moe_single_token.py
tests/test_moe_single_token_fp4.py
tests/test_native_build_preflight.py
tests/test_openai_server.py
tests/test_openai_utils.py
tests/test_package_boundaries.py
tests/test_partition_policy.py
tests/test_protocol_chat.py
tests/test_protocol_prompt.py
tests/test_protocol_requests.py
tests/test_public_api.py
tests/test_pytorch_gqa_sdpa.py
tests/test_q4k_q5k_mma.py
tests/test_q8_0_cuda.py
tests/test_qwen4_exp_fp8_dequant.py
tests/test_qwen4_exp_fp8_loader.py
tests/test_qwen4_exp_gated_delta_cuda.py
tests/test_qwen4_exp_hc_activation_cuda.py
tests/test_qwen4_exp_hyper_connection_cuda.py
tests/test_qwen4_exp_moe_cuda.py
tests/test_qwen4_exp_parity.py
tests/test_qwen4_exp_prefill_linear.py
tests/test_qwen4_exp_profiler.py
tests/test_qwen4_exp_qsa_cuda.py
tests/test_qwen4_exp_qsa_fallback.py
tests/test_qwen4_exp_qsa_indexer.py
tests/test_qwen4_exp_real_checkpoint.py
tests/test_qwen4_exp_runtime.py
tests/test_qwen4_exp_tp_sharding.py
tests/test_sdist_native_sources.py
tests/test_supervisor.py
tests/test_supervisor_orphan_guard.py
tests/test_torch_backend_config_autodetect.py
tests/test_torch_backend_prompt.py