stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3

[:python_version >= "3.13"]
audioop-lts>=0.2.2

[all]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
stream2sentence[stanza]>=1.0.3
pyttsx3>=2.99
azure-cognitiveservices-speech>=1.50.0
elevenlabs>=2.49.0
openai>=2.38.0
gtts>=2.5.4
coqui_tts>=0.27.5
edge-tts>=7.2.8
kokoro>=0.9.4
camb-sdk>=1.5.11
requests>=2.34.2
cartesia==3.1.0
typecast-python>=0.3.0
numpy
soundfile>=0.13.1
fastapi<1,>=0.115
uvicorn[standard]<1,>=0.34
fasttext-predict>=0.9.2.4
snac>=1.2.1
omnivoice>=0.1.5
chatterbox-tts
numpy<3,>=1.26
soundfile>=0.13
huggingface-hub>=0.36
phonemizer>=3.3
espeakng-loader>=0.2.4
num2words>=0.5.14
Unidecode>=1.3.8
torch>=2.6
scipy>=1.13
onnxruntime<2,>=1.18
sopro>=1.5.0
soprano-tts>=0.2.0
neutts
pocket-tts>=2.1.0
torch
scipy
safetensors
huggingface-hub>=0.36.0
torchaudio
vocos
cn2an>=0.5.24
inflect
jieba>=0.42.1
lhotse
librosa
onnxruntime
piper_phonemize
pypinyin>=0.55.0
setuptools<81
tensorboard
transformers<=4.57.6
nltk
munch
PyYAML
phonemizer
transformers

[all:python_version >= "3.13"]
audioop-lts>=0.2.2

[all:sys_platform == "linux"]
realtimetts-qwen-native[cuda12]==0.1.0

[all:sys_platform == "win32"]
realtimetts-qwen-native[cuda12]==0.1.0

[azure]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
azure-cognitiveservices-speech>=1.50.0

[azure:python_version >= "3.13"]
audioop-lts>=0.2.2

[camb]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
camb-sdk>=1.5.11

[camb:python_version >= "3.13"]
audioop-lts>=0.2.2

[cartesia]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
cartesia==3.1.0

[cartesia:python_version >= "3.13"]
audioop-lts>=0.2.2

[chatterbox]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
chatterbox-tts

[chatterbox:python_version >= "3.13"]
audioop-lts>=0.2.2

[coqui]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
coqui_tts>=0.27.5

[coqui:python_version >= "3.13"]
audioop-lts>=0.2.2

[edge]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
edge-tts>=7.2.8

[edge:python_version >= "3.13"]
audioop-lts>=0.2.2

[elevenlabs]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
elevenlabs>=2.49.0

[elevenlabs:python_version >= "3.13"]
audioop-lts>=0.2.2

[gtts]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
gtts>=2.5.4

[gtts:python_version >= "3.13"]
audioop-lts>=0.2.2

[inflect]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
numpy<3,>=1.26
soundfile>=0.13
huggingface-hub>=0.36
phonemizer>=3.3
espeakng-loader>=0.2.4
num2words>=0.5.14
Unidecode>=1.3.8
torch>=2.6
scipy>=1.13
onnxruntime<2,>=1.18

[inflect-onnx]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
numpy<3,>=1.26
soundfile>=0.13
huggingface-hub>=0.36
phonemizer>=3.3
espeakng-loader>=0.2.4
num2words>=0.5.14
Unidecode>=1.3.8
onnxruntime<2,>=1.18

[inflect-onnx:python_version >= "3.13"]
audioop-lts>=0.2.2

[inflect-pytorch]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
numpy<3,>=1.26
soundfile>=0.13
huggingface-hub>=0.36
phonemizer>=3.3
espeakng-loader>=0.2.4
num2words>=0.5.14
Unidecode>=1.3.8
torch>=2.6
scipy>=1.13

[inflect-pytorch:python_version >= "3.13"]
audioop-lts>=0.2.2

[inflect:python_version >= "3.13"]
audioop-lts>=0.2.2

[jp]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
mecab-python3>=1.0.12
unidic-lite>=1.0.8
cutlet
fugashi>=1.5.2
jaconv>=0.5.0
mojimoji>=0.0.13
pyopenjtalk>=0.4.1

[jp:python_version >= "3.13"]
audioop-lts>=0.2.2

[ko]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
hangul_romanize

[ko:python_version >= "3.13"]
audioop-lts>=0.2.2

[kokoro]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
kokoro>=0.9.4

[kokoro:python_version >= "3.13"]
audioop-lts>=0.2.2

[luxtts]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
cn2an>=0.5.24
inflect
jieba>=0.42.1
lhotse
librosa
numpy
onnxruntime
piper_phonemize
pypinyin>=0.55.0
safetensors
setuptools<81
tensorboard
torch
torchaudio
transformers<=4.57.6
vocos

[luxtts:python_version >= "3.13"]
audioop-lts>=0.2.2

[minimal]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3

[minimal:python_version >= "3.13"]
audioop-lts>=0.2.2

[minimax]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
requests>=2.34.2

[minimax:python_version >= "3.13"]
audioop-lts>=0.2.2

[modelslab]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
requests>=2.34.2

[modelslab:python_version >= "3.13"]
audioop-lts>=0.2.2

[moss]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
numpy
soundfile>=0.13.1
torch
torchaudio
onnxruntime
huggingface-hub>=0.36.0
nltk

[moss-tts]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
numpy
soundfile>=0.13.1
torch
torchaudio
onnxruntime
huggingface-hub>=0.36.0
nltk

[moss-tts:python_version >= "3.13"]
audioop-lts>=0.2.2

[moss:python_version >= "3.13"]
audioop-lts>=0.2.2

[neutts]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
neutts

[neutts-gguf]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
neutts[llama,onnx]

[neutts-gguf:python_version >= "3.13"]
audioop-lts>=0.2.2

[neutts:python_version >= "3.13"]
audioop-lts>=0.2.2

[nltk]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3

[nltk:python_version >= "3.13"]
audioop-lts>=0.2.2

[omnivoice]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
omnivoice>=0.1.5

[omnivoice:python_version >= "3.13"]
audioop-lts>=0.2.2

[openai]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
openai>=2.38.0

[openai:python_version >= "3.13"]
audioop-lts>=0.2.2

[orpheus]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
snac>=1.2.1

[orpheus:python_version >= "3.13"]
audioop-lts>=0.2.2

[parler]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
torch
transformers

[parler:python_version >= "3.13"]
audioop-lts>=0.2.2

[piper]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14

[piper:python_version >= "3.13"]
audioop-lts>=0.2.2

[playback]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14

[playback:python_version >= "3.13"]
audioop-lts>=0.2.2

[pocket]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
pocket-tts>=2.1.0
torch

[pocket-gpu]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
torch
scipy
safetensors
huggingface-hub>=0.36.0

[pocket-gpu:python_version >= "3.13"]
audioop-lts>=0.2.2

[pocket:python_version >= "3.13"]
audioop-lts>=0.2.2

[pockettts]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
pocket-tts>=2.1.0
torch

[pockettts-gpu]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
torch
scipy
safetensors
huggingface-hub>=0.36.0

[pockettts-gpu:python_version >= "3.13"]
audioop-lts>=0.2.2

[pockettts:python_version >= "3.13"]
audioop-lts>=0.2.2

[qwen]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
numpy
soundfile>=0.13.1
pyaudio>=0.2.14

[qwen-server]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
numpy
soundfile>=0.13.1
fastapi<1,>=0.115
uvicorn[standard]<1,>=0.34
fasttext-predict>=0.9.2.4

[qwen-server:python_version >= "3.13"]
audioop-lts>=0.2.2

[qwen-server:sys_platform == "linux"]
realtimetts-qwen-native[cuda12]==0.1.0

[qwen-server:sys_platform == "win32"]
realtimetts-qwen-native[cuda12]==0.1.0

[qwen:python_version >= "3.13"]
audioop-lts>=0.2.2

[qwen:sys_platform == "linux"]
realtimetts-qwen-native[cuda12]==0.1.0

[qwen:sys_platform == "win32"]
realtimetts-qwen-native[cuda12]==0.1.0

[soprano]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
soprano-tts>=0.2.0

[soprano:python_version >= "3.13"]
audioop-lts>=0.2.2

[sopro]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
sopro>=1.5.0

[sopro:python_version >= "3.13"]
audioop-lts>=0.2.2

[stanza]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
stream2sentence[stanza]>=1.0.3

[stanza:python_version >= "3.13"]
audioop-lts>=0.2.2

[style]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
torch
torchaudio
numpy
librosa
nltk
munch
PyYAML
phonemizer

[style:python_version >= "3.13"]
audioop-lts>=0.2.2

[styletts]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
torch
torchaudio
numpy
librosa
nltk
munch
PyYAML
phonemizer

[styletts:python_version >= "3.13"]
audioop-lts>=0.2.2

[system]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
pyttsx3>=2.99

[system:python_version >= "3.13"]
audioop-lts>=0.2.2

[typecast]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
typecast-python>=0.3.0

[typecast:python_version >= "3.13"]
audioop-lts>=0.2.2

[zh]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
pypinyin>=0.55.0
ordered_set>=4.1.0
jieba>=0.42.1
cn2an>=0.5.24

[zh:python_version >= "3.13"]
audioop-lts>=0.2.2

[zipvoice]
stream2sentence[nltk]>=1.0.3
pydub>=0.25.1
resampy==0.4.3
pyaudio>=0.2.14
torch
torchaudio
numpy
huggingface-hub>=0.36.0
safetensors
vocos

[zipvoice:python_version >= "3.13"]
audioop-lts>=0.2.2
