LICENSE
MANIFEST.in
Makefile
README.md
README_VIE.md
pyproject.toml
setup.py
H:/Litetorch/src/autograd.cpp
H:/Litetorch/src/cl_backend.cpp
H:/Litetorch/src/data.cpp
H:/Litetorch/src/memory_manager.cpp
H:/Litetorch/src/nn.cpp
H:/Litetorch/src/ops.cpp
H:/Litetorch/src/optim.cpp
H:/Litetorch/src/serialization.cpp
H:/Litetorch/src/tensor.cpp
H:/Litetorch/src/autograd/autograd_engine.cpp
H:/Litetorch/src/autograd/checkpoint.cpp
H:/Litetorch/src/autograd/saved_tensor.cpp
H:/Litetorch/src/backend/backend.cpp
H:/Litetorch/src/bindings/python_bindings.cpp
H:/Litetorch/src/cl_backend/cl_backend.cpp
H:/Litetorch/src/cl_backend/cl_functions.cpp
H:/Litetorch/src/cl_backend/command_graph.cpp
H:/Litetorch/src/data/dataloader.cpp
H:/Litetorch/src/data/dataset.cpp
H:/Litetorch/src/distributed/context_parallel.cpp
H:/Litetorch/src/distributed/distributed.cpp
H:/Litetorch/src/distributed/fsdp_wrapper.cpp
H:/Litetorch/src/distributed/shm_ipc.cpp
H:/Litetorch/src/llm/continuous_batching.cpp
H:/Litetorch/src/llm/guided_decoding.cpp
H:/Litetorch/src/llm/medusa.cpp
H:/Litetorch/src/memory_manager/allocator.cpp
H:/Litetorch/src/memory_manager/memory_manager.cpp
H:/Litetorch/src/nn/activation.cpp
H:/Litetorch/src/nn/attention.cpp
H:/Litetorch/src/nn/container.cpp
H:/Litetorch/src/nn/convolution.cpp
H:/Litetorch/src/nn/dropout.cpp
H:/Litetorch/src/nn/embedding.cpp
H:/Litetorch/src/nn/linear.cpp
H:/Litetorch/src/nn/llm_serving.cpp
H:/Litetorch/src/nn/loss.cpp
H:/Litetorch/src/nn/moe.cpp
H:/Litetorch/src/nn/normalization.cpp
H:/Litetorch/src/nn/parallel_linear.cpp
H:/Litetorch/src/nn/pooling.cpp
H:/Litetorch/src/nn/qlora.cpp
H:/Litetorch/src/nn/transformer.cpp
H:/Litetorch/src/ops/activation.cpp
H:/Litetorch/src/ops/attention.cpp
H:/Litetorch/src/ops/cast.cpp
H:/Litetorch/src/ops/checkpoint.cpp
H:/Litetorch/src/ops/clip_grad.cpp
H:/Litetorch/src/ops/convolution.cpp
H:/Litetorch/src/ops/custom_ops.cpp
H:/Litetorch/src/ops/elementwise.cpp
H:/Litetorch/src/ops/flash_decoding.cpp
H:/Litetorch/src/ops/fused_loss.cpp
H:/Litetorch/src/ops/jit.cpp
H:/Litetorch/src/ops/kernels.cpp
H:/Litetorch/src/ops/linear.cpp
H:/Litetorch/src/ops/loss.cpp
H:/Litetorch/src/ops/moe_ops.cpp
H:/Litetorch/src/ops/normalization.cpp
H:/Litetorch/src/ops/pooling.cpp
H:/Litetorch/src/ops/quantization_ops.cpp
H:/Litetorch/src/ops/ring_attention.cpp
H:/Litetorch/src/ops/rope.cpp
H:/Litetorch/src/ops/scaled_matmul.cpp
H:/Litetorch/src/ops/w8a8_ops.cpp
H:/Litetorch/src/optim/adam.cpp
H:/Litetorch/src/optim/adamw.cpp
H:/Litetorch/src/optim/adamw_8bit.cpp
H:/Litetorch/src/optim/adamw_fp8.cpp
H:/Litetorch/src/optim/cosine_annealing.cpp
H:/Litetorch/src/optim/grad_scaler.cpp
H:/Litetorch/src/optim/optimizer.cpp
H:/Litetorch/src/optim/rmsprop.cpp
H:/Litetorch/src/optim/sgd.cpp
H:/Litetorch/src/optim/steplr.cpp
H:/Litetorch/src/optim/zero3_optimizer.cpp
H:/Litetorch/src/serialization/optimizer.cpp
H:/Litetorch/src/serialization/parameters.cpp
H:/Litetorch/src/tensor/storage.cpp
H:/Litetorch/src/tensor/tensor_core.cpp
docs-en/1.index.md
docs-en/10.quantization_and_jit.md
docs-en/11.data_and_io.md
docs-en/12.cpp_api.md
docs-en/2.installation.md
docs-en/3.quickstart.md
docs-en/4.tensor_and_autograd.md
docs-en/5.operators.md
docs-en/6.neural_networks.md
docs-en/7.optimizers_and_amp.md
docs-en/8.distributed_training.md
docs-en/9.llm_serving.md
docs-vie/1.index.md
docs-vie/10.quantization_and_jit.md
docs-vie/11.data_and_io.md
docs-vie/12.cpp_api.md
docs-vie/2.installation.md
docs-vie/3.quickstart.md
docs-vie/4.tensor_and_autograd.md
docs-vie/5.operators.md
docs-vie/6.neural_networks.md
docs-vie/7.optimizers_and_amp.md
docs-vie/8.distributed_training.md
docs-vie/9.llm_serving.md
include/litetorch/allocator.h
include/litetorch/amp.h
include/litetorch/autograd.h
include/litetorch/backend.h
include/litetorch/checkpoint.h
include/litetorch/cl_backend.h
include/litetorch/context_parallel.h
include/litetorch/continuous_batching.h
include/litetorch/custom_ops.h
include/litetorch/data.h
include/litetorch/device.h
include/litetorch/device_mesh.h
include/litetorch/distributed.h
include/litetorch/dtensor.h
include/litetorch/fsdp.h
include/litetorch/fsdp_wrapper.h
include/litetorch/grad_scaler.h
include/litetorch/guided_decoding.h
include/litetorch/jit.h
include/litetorch/llm_serving.h
include/litetorch/memory_manager.h
include/litetorch/nn.h
include/litetorch/ops.h
include/litetorch/optim.h
include/litetorch/platform.h
include/litetorch/quantization.h
include/litetorch/serialization.h
include/litetorch/tensor.h
include/litetorch/thread_pool.h
include/litetorch/zero3_optimizer.h
litetorch.egg-info/PKG-INFO
litetorch.egg-info/SOURCES.txt
litetorch.egg-info/dependency_links.txt
litetorch.egg-info/entry_points.txt
litetorch.egg-info/not-zip-safe
litetorch.egg-info/top_level.txt
src/autograd.cpp
src/cl_backend.cpp
src/data.cpp
src/memory_manager.cpp
src/nn.cpp
src/ops.cpp
src/optim.cpp
src/serialization.cpp
src/tensor.cpp
src/autograd/autograd_engine.cpp
src/autograd/checkpoint.cpp
src/autograd/saved_tensor.cpp
src/backend/backend.cpp
src/backend/gpu_native/entrypoint.cu
src/backend/gpu_native/kernels.cu
src/backend/gpu_native/kernels.hip
src/backend/gpu_native/common/gpu_common.h
src/backend/gpu_native/elementwise/elementwise_ops.cu
src/backend/gpu_native/math/gemm.cu
src/backend/gpu_native/math/reduction.cu
src/backend/gpu_native/nn/flash_attention.cu
src/backend/gpu_native/nn/nn_kernels.cu
src/backend/gpu_native/optim/optimizers.cu
src/bindings/python_bindings.cpp
src/cl_backend/cl_backend.cpp
src/cl_backend/cl_functions.cpp
src/cl_backend/cl_functions.h
src/cl_backend/command_graph.cpp
src/data/dataloader.cpp
src/data/dataset.cpp
src/distributed/context_parallel.cpp
src/distributed/distributed.cpp
src/distributed/fsdp_wrapper.cpp
src/distributed/shm_ipc.cpp
src/llm/continuous_batching.cpp
src/llm/guided_decoding.cpp
src/llm/medusa.cpp
src/memory_manager/allocator.cpp
src/memory_manager/memory_manager.cpp
src/nn/activation.cpp
src/nn/attention.cpp
src/nn/container.cpp
src/nn/convolution.cpp
src/nn/dropout.cpp
src/nn/embedding.cpp
src/nn/linear.cpp
src/nn/llm_serving.cpp
src/nn/loss.cpp
src/nn/moe.cpp
src/nn/nn_utils.h
src/nn/normalization.cpp
src/nn/parallel_linear.cpp
src/nn/pooling.cpp
src/nn/qlora.cpp
src/nn/transformer.cpp
src/ops/activation.cpp
src/ops/attention.cpp
src/ops/cast.cpp
src/ops/checkpoint.cpp
src/ops/clip_grad.cpp
src/ops/convolution.cpp
src/ops/custom_ops.cpp
src/ops/elementwise.cpp
src/ops/flash_decoding.cpp
src/ops/fused_loss.cpp
src/ops/jit.cpp
src/ops/kernels.cl
src/ops/kernels.cpp
src/ops/linear.cpp
src/ops/loss.cpp
src/ops/moe_ops.cpp
src/ops/normalization.cpp
src/ops/pooling.cpp
src/ops/quantization_ops.cpp
src/ops/ring_attention.cpp
src/ops/rope.cpp
src/ops/scaled_matmul.cpp
src/ops/w8a8_ops.cpp
src/optim/adam.cpp
src/optim/adamw.cpp
src/optim/adamw_8bit.cpp
src/optim/adamw_fp8.cpp
src/optim/cosine_annealing.cpp
src/optim/grad_scaler.cpp
src/optim/optim_utils.h
src/optim/optimizer.cpp
src/optim/rmsprop.cpp
src/optim/sgd.cpp
src/optim/steplr.cpp
src/optim/zero3_optimizer.cpp
src/serialization/optimizer.cpp
src/serialization/parameters.cpp
src/tensor/storage.cpp
src/tensor/tensor_core.cpp
tests/advanced_features_test.cpp
tests/advanced_optimization_stage2_test.cpp
tests/advanced_serving_test.cpp
tests/allocator_test.cpp
tests/attention_test.cpp
tests/audit_bugs_test.cpp
tests/audit_optimizations_test.cpp
tests/backend_detection_test.cpp
tests/checkpoint_test.cpp
tests/demo_run.cpp
tests/demo_run.py
tests/distributed_test.cpp
tests/double_backward_test.cpp
tests/fusion_benchmark.cpp
tests/gpt_training_test.cpp
tests/gpu_allocator_test.cpp
tests/gpu_cast_test.cpp
tests/gpu_half_perf_test.cpp
tests/jit_test.cpp
tests/llm_optimization_test.cpp
tests/memory_leak_test.cpp
tests/new_features_test.cpp
tests/production_features_test.cpp
tests/production_optimization_test.cpp
tests/scale_upgrade_test.cpp
tests/stage4_test.cpp
tests/stress_test.cpp
tests/test_litetorch.py
tests/transformer_test.cpp