LICENSE
README.md
THIRDPARTYNOTICES
pyproject.toml
tokenspeed/__init__.py
tokenspeed/_logging.py
tokenspeed/bench.py
tokenspeed/env.py
tokenspeed/version.py
tokenspeed.egg-info/PKG-INFO
tokenspeed.egg-info/SOURCES.txt
tokenspeed.egg-info/dependency_links.txt
tokenspeed.egg-info/entry_points.txt
tokenspeed.egg-info/requires.txt
tokenspeed.egg-info/top_level.txt
tokenspeed/cli/__init__.py
tokenspeed/cli/__main__.py
tokenspeed/cli/_argsplit.py
tokenspeed/cli/_logo.py
tokenspeed/cli/_logprefix.py
tokenspeed/cli/_proc.py
tokenspeed/cli/serve_smg.py
tokenspeed/cli/trace_merge.py
tokenspeed/runtime/cache/__init__.py
tokenspeed/runtime/cache/allocator.py
tokenspeed/runtime/cache/base_prefix_cache.py
tokenspeed/runtime/cache/embedding_cache.py
tokenspeed/runtime/cache/evict_policy.py
tokenspeed/runtime/cache/flat_host_mirror.py
tokenspeed/runtime/cache/kv_cache_host.py
tokenspeed/runtime/cache/kvstore_controller.py
tokenspeed/runtime/cache/kvstore_storage.py
tokenspeed/runtime/cache/mamba_cache_host.py
tokenspeed/runtime/cache/prefix_cache.py
tokenspeed/runtime/cache/req_to_token_pool.py
tokenspeed/runtime/cache/utils.py
tokenspeed/runtime/cache/executor/__init__.py
tokenspeed/runtime/cache/executor/flat_memory_executor.py
tokenspeed/runtime/cache/executor/host_executor.py
tokenspeed/runtime/cache/executor/memory_executor.py
tokenspeed/runtime/cache/executor/storage_executor.py
tokenspeed/runtime/cache/storage/__init__.py
tokenspeed/runtime/cache/storage/backend_factory.py
tokenspeed/runtime/cache/storage/mooncake_store/mooncake_store.py
tokenspeed/runtime/cache/transfer/__init__.py
tokenspeed/runtime/cache/transfer/kv_pool.py
tokenspeed/runtime/cache/transfer/mamba_pool.py
tokenspeed/runtime/cache/transfer/pool.py
tokenspeed/runtime/cache/transfer/types.py
tokenspeed/runtime/configs/__init__.py
tokenspeed/runtime/configs/deepseek_v4_cache_spec.py
tokenspeed/runtime/configs/deepseek_v4_config.py
tokenspeed/runtime/configs/device_config.py
tokenspeed/runtime/configs/flat_memory_plan.py
tokenspeed/runtime/configs/inkling_config.py
tokenspeed/runtime/configs/kimi_k25_config.py
tokenspeed/runtime/configs/kimi_k2_config.py
tokenspeed/runtime/configs/load_config.py
tokenspeed/runtime/configs/minimax_m2_config.py
tokenspeed/runtime/configs/minimax_m3_config.py
tokenspeed/runtime/configs/model_config.py
tokenspeed/runtime/configs/paged_cache_spec.py
tokenspeed/runtime/configs/qwen2_config.py
tokenspeed/runtime/configs/qwen3_5_config.py
tokenspeed/runtime/configs/qwen3_5_text_base_config.py
tokenspeed/runtime/configs/qwen3_asr_config.py
tokenspeed/runtime/configs/qwen3_config.py
tokenspeed/runtime/configs/qwen3_moe_config.py
tokenspeed/runtime/configs/qwen3_vision_config.py
tokenspeed/runtime/configs/utils.py
tokenspeed/runtime/distributed/__init__.py
tokenspeed/runtime/distributed/comm_manager.py
tokenspeed/runtime/distributed/comm_ops.py
tokenspeed/runtime/distributed/dp_sampling_comm.py
tokenspeed/runtime/distributed/dp_sampling_swap.py
tokenspeed/runtime/distributed/mapping.py
tokenspeed/runtime/distributed/process_group_manager.py
tokenspeed/runtime/distributed/utils.py
tokenspeed/runtime/distributed/comm_backend/__init__.py
tokenspeed/runtime/distributed/comm_backend/auto.py
tokenspeed/runtime/distributed/comm_backend/base.py
tokenspeed/runtime/distributed/comm_backend/custom_allreduce.py
tokenspeed/runtime/distributed/comm_backend/nccl.py
tokenspeed/runtime/distributed/comm_backend/registry.py
tokenspeed/runtime/distributed/comm_backend/triton_allreduce.py
tokenspeed/runtime/distributed/comm_backend/triton_rsag.py
tokenspeed/runtime/distributed/comm_backend/trtllm_allreduce.py
tokenspeed/runtime/distributed/device_communicators/custom_all_reduce.py
tokenspeed/runtime/distributed/device_communicators/pynccl.py
tokenspeed/runtime/distributed/device_communicators/utils.py
tokenspeed/runtime/engine/__init__.py
tokenspeed/runtime/engine/aio_rwlock.py
tokenspeed/runtime/engine/async_llm.py
tokenspeed/runtime/engine/collector.py
tokenspeed/runtime/engine/core_client.py
tokenspeed/runtime/engine/data_parallel_controller.py
tokenspeed/runtime/engine/detokenizer.py
tokenspeed/runtime/engine/event_loop.py
tokenspeed/runtime/engine/exceptions.py
tokenspeed/runtime/engine/generation_output_processor.py
tokenspeed/runtime/engine/input_processor.py
tokenspeed/runtime/engine/io_struct.py
tokenspeed/runtime/engine/llm.py
tokenspeed/runtime/engine/logprobs.py
tokenspeed/runtime/engine/memory_occupation.py
tokenspeed/runtime/engine/output_processor.py
tokenspeed/runtime/engine/parallel_sampling.py
tokenspeed/runtime/engine/pause.py
tokenspeed/runtime/engine/protocol.py
tokenspeed/runtime/engine/request.py
tokenspeed/runtime/engine/request_handler.py
tokenspeed/runtime/engine/request_stats.py
tokenspeed/runtime/engine/request_types.py
tokenspeed/runtime/engine/scheduler_control_client.py
tokenspeed/runtime/engine/scheduler_utils.py
tokenspeed/runtime/engine/weight_transfer/__init__.py
tokenspeed/runtime/engine/weight_transfer/config.py
tokenspeed/runtime/engine/weight_transfer/manager.py
tokenspeed/runtime/entrypoints/control_server.py
tokenspeed/runtime/entrypoints/engine.py
tokenspeed/runtime/entrypoints/engine_base.py
tokenspeed/runtime/entrypoints/sglang_compat_http.py
tokenspeed/runtime/entrypoints/vllm_compat_http.py
tokenspeed/runtime/epd/encode_executor.py
tokenspeed/runtime/epd/encode_loop.py
tokenspeed/runtime/epd/encode_scheduler.py
tokenspeed/runtime/epd/encode_worker.py
tokenspeed/runtime/epd/entities.py
tokenspeed/runtime/epd/prefill_admission.py
tokenspeed/runtime/epd/mooncake/conn.py
tokenspeed/runtime/epd/mooncake/encode.py
tokenspeed/runtime/epd/mooncake/prefill.py
tokenspeed/runtime/epd/mooncake/receiver.py
tokenspeed/runtime/epd/mooncake/sender.py
tokenspeed/runtime/execution/breakable_cuda_graph.py
tokenspeed/runtime/execution/cache_loc_kernel.py
tokenspeed/runtime/execution/context.py
tokenspeed/runtime/execution/cuda_graph_wrapper.py
tokenspeed/runtime/execution/distributed_initializer.py
tokenspeed/runtime/execution/factory.py
tokenspeed/runtime/execution/forward_batch_info.py
tokenspeed/runtime/execution/input_buffer.py
tokenspeed/runtime/execution/model_executor.py
tokenspeed/runtime/execution/model_runner.py
tokenspeed/runtime/execution/nan_guard.py
tokenspeed/runtime/execution/prefill_graph.py
tokenspeed/runtime/execution/runtime_states.py
tokenspeed/runtime/execution/types.py
tokenspeed/runtime/execution/weight_loader.py
tokenspeed/runtime/execution/drafter/__init__.py
tokenspeed/runtime/execution/drafter/_dflash_fused_kv.py
tokenspeed/runtime/execution/drafter/base.py
tokenspeed/runtime/execution/drafter/dflash.py
tokenspeed/runtime/execution/drafter/eagle.py
tokenspeed/runtime/execution/drafter/mtp.py
tokenspeed/runtime/grammar/__init__.py
tokenspeed/runtime/grammar/base_grammar_backend.py
tokenspeed/runtime/grammar/capturable_grammar.py
tokenspeed/runtime/grammar/grammar_manager.py
tokenspeed/runtime/grammar/reasoning_structural_tag.py
tokenspeed/runtime/grammar/xgrammar_backend.py
tokenspeed/runtime/layers/activation.py
tokenspeed/runtime/layers/common.py
tokenspeed/runtime/layers/conv.py
tokenspeed/runtime/layers/deepseek_v4_mhc.py
tokenspeed/runtime/layers/layernorm.py
tokenspeed/runtime/layers/linear.py
tokenspeed/runtime/layers/logits_processor.py
tokenspeed/runtime/layers/paged_attention.py
tokenspeed/runtime/layers/parameter.py
tokenspeed/runtime/layers/rotary_embedding.py
tokenspeed/runtime/layers/utils.py
tokenspeed/runtime/layers/vocab_parallel_embedding.py
tokenspeed/runtime/layers/attention/chunk.py
tokenspeed/runtime/layers/attention/deepseek_v4_ops.py
tokenspeed/runtime/layers/attention/mm_encoder_attention.py
tokenspeed/runtime/layers/attention/registry.py
tokenspeed/runtime/layers/attention/utils.py
tokenspeed/runtime/layers/attention/backends/__init__.py
tokenspeed/runtime/layers/attention/backends/base.py
tokenspeed/runtime/layers/attention/backends/deepseek_v4.py
tokenspeed/runtime/layers/attention/backends/dsa.py
tokenspeed/runtime/layers/attention/backends/flashmla.py
tokenspeed/runtime/layers/attention/backends/flat_groups.py
tokenspeed/runtime/layers/attention/backends/hybrid_linear_attn.py
tokenspeed/runtime/layers/attention/backends/inkling.py
tokenspeed/runtime/layers/attention/backends/mha.py
tokenspeed/runtime/layers/attention/backends/mla.py
tokenspeed/runtime/layers/attention/backends/msa.py
tokenspeed/runtime/layers/attention/backends/tokenspeed_mla.py
tokenspeed/runtime/layers/attention/backends/trtllm.py
tokenspeed/runtime/layers/attention/backends/trtllm_mla.py
tokenspeed/runtime/layers/attention/configs/base.py
tokenspeed/runtime/layers/attention/configs/dsa.py
tokenspeed/runtime/layers/attention/configs/mha.py
tokenspeed/runtime/layers/attention/configs/mla.py
tokenspeed/runtime/layers/attention/configs/msa.py
tokenspeed/runtime/layers/attention/deepseek_v4/metadata.py
tokenspeed/runtime/layers/attention/dsa/utils.py
tokenspeed/runtime/layers/attention/kv_cache/base.py
tokenspeed/runtime/layers/attention/kv_cache/deepseek_v4.py
tokenspeed/runtime/layers/attention/kv_cache/dsa.py
tokenspeed/runtime/layers/attention/kv_cache/flat_state_slabs.py
tokenspeed/runtime/layers/attention/kv_cache/mha.py
tokenspeed/runtime/layers/attention/kv_cache/mla.py
tokenspeed/runtime/layers/attention/kv_cache/msa.py
tokenspeed/runtime/layers/attention/kv_cache/utils.py
tokenspeed/runtime/layers/attention/linear/causal_conv1d.py
tokenspeed/runtime/layers/attention/linear/gdn.py
tokenspeed/runtime/layers/attention/linear/layernorm_gated.py
tokenspeed/runtime/layers/attention/linear/mamba_state_scatter_triton.py
tokenspeed/runtime/layers/dense/__init__.py
tokenspeed/runtime/layers/dense/fp8.py
tokenspeed/runtime/layers/dense/mxfp4.py
tokenspeed/runtime/layers/dense/nvfp4.py
tokenspeed/runtime/layers/dense/unquant.py
tokenspeed/runtime/layers/dense/utils.py
tokenspeed/runtime/layers/dense/w8a8_fp8.py
tokenspeed/runtime/layers/moe/__init__.py
tokenspeed/runtime/layers/moe/config.py
tokenspeed/runtime/layers/moe/expert.py
tokenspeed/runtime/layers/moe/loader.py
tokenspeed/runtime/layers/moe/schema.py
tokenspeed/runtime/layers/moe/topk.py
tokenspeed/runtime/layers/moe/types.py
tokenspeed/runtime/layers/moe/utils.py
tokenspeed/runtime/layers/moe/weights/__init__.py
tokenspeed/runtime/layers/moe/weights/fp8.py
tokenspeed/runtime/layers/moe/weights/loaders.py
tokenspeed/runtime/layers/moe/weights/mxfp4.py
tokenspeed/runtime/layers/moe/weights/mxint4.py
tokenspeed/runtime/layers/moe/weights/nvfp4.py
tokenspeed/runtime/layers/moe/weights/unquant.py
tokenspeed/runtime/layers/quantization/__init__.py
tokenspeed/runtime/layers/quantization/base_config.py
tokenspeed/runtime/layers/quantization/fp8.py
tokenspeed/runtime/layers/quantization/modelopt_mixed.py
tokenspeed/runtime/layers/quantization/mxfp4.py
tokenspeed/runtime/layers/quantization/nvfp4.py
tokenspeed/runtime/layers/quantization/utils.py
tokenspeed/runtime/layers/quantization/w8a8_fp8.py
tokenspeed/runtime/layers/quantization/compressed_tensors/__init__.py
tokenspeed/runtime/layers/quantization/compressed_tensors/compressed_tensors.py
tokenspeed/runtime/layers/quantization/compressed_tensors/gptq_marlin_moe.py
tokenspeed/runtime/layers/quantization/compressed_tensors/scalar_type.py
tokenspeed/runtime/layers/quantization/compressed_tensors/schemes/__init__.py
tokenspeed/runtime/layers/quantization/compressed_tensors/schemes/compressed_tensors_scheme.py
tokenspeed/runtime/layers/quantization/compressed_tensors/schemes/compressed_tensors_wNa16.py
tokenspeed/runtime/metrics/collector.py
tokenspeed/runtime/metrics/func_timer.py
tokenspeed/runtime/metrics/utils.py
tokenspeed/runtime/model_loader/__init__.py
tokenspeed/runtime/model_loader/loader.py
tokenspeed/runtime/model_loader/utils.py
tokenspeed/runtime/model_loader/weight_utils.py
tokenspeed/runtime/models/deepseek_nextn.py
tokenspeed/runtime/models/deepseek_v3.py
tokenspeed/runtime/models/deepseek_v4.py
tokenspeed/runtime/models/deepseek_v4_mtp.py
tokenspeed/runtime/models/dflash.py
tokenspeed/runtime/models/extensible.py
tokenspeed/runtime/models/glm5.py
tokenspeed/runtime/models/glm5_nextn.py
tokenspeed/runtime/models/gpt_oss.py
tokenspeed/runtime/models/inkling.py
tokenspeed/runtime/models/inkling_nextn.py
tokenspeed/runtime/models/kimi_k25.py
tokenspeed/runtime/models/llama.py
tokenspeed/runtime/models/llama_eagle3.py
tokenspeed/runtime/models/longcat_flash.py
tokenspeed/runtime/models/minimax_m2.py
tokenspeed/runtime/models/minimax_m3.py
tokenspeed/runtime/models/qwen2.py
tokenspeed/runtime/models/qwen3.py
tokenspeed/runtime/models/qwen3_5.py
tokenspeed/runtime/models/qwen3_5_moe.py
tokenspeed/runtime/models/qwen3_5_nextn.py
tokenspeed/runtime/models/qwen3_asr.py
tokenspeed/runtime/models/qwen3_audio.py
tokenspeed/runtime/models/qwen3_moe.py
tokenspeed/runtime/models/qwen3_omni.py
tokenspeed/runtime/models/qwen3_vision.py
tokenspeed/runtime/models/registry.py
tokenspeed/runtime/models/utils.py
tokenspeed/runtime/models/base/__init__.py
tokenspeed/runtime/models/base/causal_lm.py
tokenspeed/runtime/models/base/comm_ops.py
tokenspeed/runtime/models/base/compiler.py
tokenspeed/runtime/models/base/decoder_layer.py
tokenspeed/runtime/models/base/execution.py
tokenspeed/runtime/models/base/module_spec.py
tokenspeed/runtime/models/base/placement.py
tokenspeed/runtime/models/base/transformer_model.py
tokenspeed/runtime/moe/__init__.py
tokenspeed/runtime/moe/distribution_recorder.py
tokenspeed/runtime/moe/expert_location.py
tokenspeed/runtime/moe/eplb_algorithms/__init__.py
tokenspeed/runtime/moe/eplb_algorithms/deepseek.py
tokenspeed/runtime/multimodal/__init__.py
tokenspeed/runtime/multimodal/embedder.py
tokenspeed/runtime/multimodal/encoder_cudagraph.py
tokenspeed/runtime/multimodal/hash.py
tokenspeed/runtime/multimodal/inputs.py
tokenspeed/runtime/multimodal/mrope.py
tokenspeed/runtime/multimodal/shm_transport.py
tokenspeed/runtime/pd/decode_executor.py
tokenspeed/runtime/pd/factory.py
tokenspeed/runtime/pd/kv_events.py
tokenspeed/runtime/pd/prefill_executor.py
tokenspeed/runtime/pd/transfer_plan.py
tokenspeed/runtime/pd/utils.py
tokenspeed/runtime/pd/base/bootstrap.py
tokenspeed/runtime/pd/base/manager.py
tokenspeed/runtime/pd/base/mooncake_engine.py
tokenspeed/runtime/pd/base/status.py
tokenspeed/runtime/pd/mooncake/__init__.py
tokenspeed/runtime/pd/mooncake/async_conn.py
tokenspeed/runtime/pd/mooncake/conn.py
tokenspeed/runtime/pd/mooncake/decode.py
tokenspeed/runtime/pd/mooncake/entities.py
tokenspeed/runtime/pd/mooncake/prefill.py
tokenspeed/runtime/pd/mooncake/receiver.py
tokenspeed/runtime/pd/mooncake/sender.py
tokenspeed/runtime/sampling/custom_logit_processor.py
tokenspeed/runtime/sampling/dp_sampling_config.py
tokenspeed/runtime/sampling/logits_layout.py
tokenspeed/runtime/sampling/registry.py
tokenspeed/runtime/sampling/sampling_batch_info.py
tokenspeed/runtime/sampling/sampling_params.py
tokenspeed/runtime/sampling/utils.py
tokenspeed/runtime/sampling/backends/__init__.py
tokenspeed/runtime/sampling/backends/base.py
tokenspeed/runtime/sampling/backends/flashinfer.py
tokenspeed/runtime/sampling/backends/flashinfer_full.py
tokenspeed/runtime/sampling/backends/greedy.py
tokenspeed/runtime/sampling/backends/triton.py
tokenspeed/runtime/sampling/backends/triton_full.py
tokenspeed/runtime/utils/__init__.py
tokenspeed/runtime/utils/common.py
tokenspeed/runtime/utils/cuda_stream.py
tokenspeed/runtime/utils/custom_ops.py
tokenspeed/runtime/utils/dispatch.py
tokenspeed/runtime/utils/env.py
tokenspeed/runtime/utils/exceptions.py
tokenspeed/runtime/utils/flashinfer_config.py
tokenspeed/runtime/utils/hf_transformers_utils.py
tokenspeed/runtime/utils/hostfunc.py
tokenspeed/runtime/utils/network.py
tokenspeed/runtime/utils/nvtx.py
tokenspeed/runtime/utils/pdl.py
tokenspeed/runtime/utils/process.py
tokenspeed/runtime/utils/server_args.py
tokenspeed/runtime/utils/text.py
tokenspeed/runtime/utils/torch_memory_saver_adapter.py
tokenspeed/runtime/utils/warmup.py