apache-tvm-ffi<0.2,>=0.1.11
click
cuda-python>=12.0
cuda-tile>=1.4.0
einops
nccl-extensions>=0.1.0
nccl4py>=0.4.1
ninja
numpy
nvidia-cudnn-frontend>=1.30.0
nvidia-cutlass-dsl>=4.6.2a0
nvidia-ml-py
packaging>=24.2
requests
tabulate
torch
tqdm

[cu12]
nvidia-cutlass-dsl>=4.7.0a0

[cu13]
nvidia-cutlass-dsl[cu13]>=4.7.0a0

[nvep]

[sm107]
nvidia-cutlass-dsl[cu13]>=4.8.0.dev0
nvshmem4py-cu13>=0.3.1
torch>=2.8
