Kyutai TTS एकीकरण
Kyutai TTS मॉडल स्थानीय चलाएँ। गाइड Libre WebUI के OpenAI-compatible servers के साथ Pocket TTS (CPU) और TTS 1.6B (GPU) कवर करता है।
अवलोकन
| मॉडल | पैरामीटर | डिवाइस | उपयुक्त |
|---|---|---|---|
| Pocket TTS | 100M | केवल CPU | Laptop, कम संसाधन |
| TTS 1.6B | 1.6B | GPU/MPS/CPU | सर्वर, उच्च गुणवत्ता |
दोनों CALM (Continuous ऑडियो भाषा मॉडल) और ऑडियो sample से आवाज़ क्लोनिंग समर्थन करते हैं।
Pocket TTS (CPU)
CPU पर real-समय हल्का TTS, GPU नहीं।
आवश्यकताएँ
| Component | न्यूनतम |
|---|---|
| Python | 3.10 - 3.14 |
| PyTorch | 2.5+ |
| RAM | 4GB |
| Disk | 500MB |
त्वरित शुरुआत
cd examples/kyutai-tts-server
# Create virtual environment
python3 -m venv venv
source venv/bin/activate
# Install dependencies
pip install -r requirements.txt
# Start server
python server.py
सर्वर http://localhost:8200।
परीक्षण
curl http://localhost:8200/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{"model": "kyutai-tts", "input": "Hello, welcome to Libre WebUI!", "voice": "alba"}' \
--output speech.wav
आवाज़ें
| आवाज़ | विवरण |
|---|---|
| Alba | महिला, स्पष्ट/प्राकृतिक |
| Marius | पुरुष, गर्म |
| Javert | पुरुष, प्रभावी |
| Jean | पुरुष, नरम |
| Fantine | महिला, मुलायम |
| Cosette | महिला, युवा |
| Eponine | महिला, अभिव्यंजक |
| Azelma | महिला, उज्ज्वल |
प्रदर्शन
- MacBook Air M4 पर ~6x real-समय
- पहला खंड ~200ms
- केवल 2 CPU cores
TTS 1.6B (GPU)
GPU acceleration और स्वचालित CUDA > MPS > CPU चयन।
आवश्यकताएँ
| Component | न्यूनतम | अनुशंसित |
|---|---|---|
| Python | 3.10+ | 3.12 |
| GPU VRAM | 6GB | 8GB+ |
| RAM | 8GB | 16GB+ |
| Disk | 4GB | 8GB |
प्लेटफ़ॉर्म समर्थन
| Platform | बैकएंड | Notes |
|---|---|---|
| NVIDIA GPU | CUDA | सर्वोत्तम, bfloat16 |
| Apple Silicon | MPS | float16 |
| CPU | PyTorch | धीमा, float32 |
त्वरित शुरुआत
cd examples/kyutai-tts-1.6b-server
# Create virtual environment
python3 -m venv venv
source venv/bin/activate
# Install PyTorch with CUDA (for NVIDIA GPUs)
pip install torch --index-url https://download.pytorch.org/whl/cu121
# Install dependencies
pip install -r requirements.txt
# Start server (auto-detects GPU)
python server.py
सर्वर http://localhost:8201।
डिवाइस चयन
# Auto-detect (CUDA > MPS > CPU)
python server.py
# Force specific device
python server.py --device cuda
python server.py --device mps
python server.py --device cpu
परीक्षण
curl http://localhost:8201/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{"model": "kyutai-tts-1.6b", "input": "Hello from the GPU!", "voice": "alba"}' \
--output speech.wav
आवाज़ें
Alba MacKenna (CC BY 4.0):
| आवाज़ | Style |
|---|---|
alba / alba-casual | अनौपचारिक |
alba-merchant | व्यापारी |
alba-announcer | घोषक |
Expresso (CC BY-NC 4.0 — गैर-व्यावसायिक):
| आवाज़ | Emotion |
|---|---|
expresso-happy | खुश |
expresso-sad | उदास |
expresso-angry | क्रोधित |
VCTK (CC BY 4.0):
vctk-p225,vctk-p226,vctk-p227,vctk-p228
आवाज़ क्लोनिंग
Pocket TTS
# From local file
curl http://localhost:8200/v1/audio/voice-clone \
-F "input=Hello from a cloned voice" \
-F "reference_audio=@my_voice.wav" \
--output cloned.wav
# From HuggingFace URL
curl http://localhost:8200/v1/audio/voice-clone-url \
-H "Content-Type: application/json" \
-d '{
"input": "Hello world!",
"voice_url": "hf://kyutai/tts-voices/alba-mackenna/casual.wav"
}' \
--output speech.wav
TTS 1.6B
किसी HuggingFace आवाज़ पथ को voice दें:
curl http://localhost:8201/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{
"model": "kyutai-tts-1.6b",
"input": "Custom voice synthesis",
"voice": "hf://kyutai/tts-voices/vctk/p230.wav"
}' \
--output speech.wav
API संदर्भ
Speech जनरेशन
एंडपॉइंट: POST /v1/audio/speech
{
"model": "kyutai-tts",
"input": "Text to convert to speech",
"voice": "alba",
"response_format": "wav",
"stream": false
}
| पैरामीटर | प्रकार | डिफ़ॉल्ट | विवरण |
|---|---|---|---|
model | स्ट्रिंग | बदलता है | kyutai-tts या kyutai-tts-1.6b |
input | स्ट्रिंग | आवश्यक | संश्लेषित पाठ, अधिकतम 10,000 अक्षर |
voice | स्ट्रिंग | alba | आवाज़ का नाम या HuggingFace पथ |
response_format | स्ट्रिंग | wav | ऑडियो प्रारूप, केवल wav समर्थित |
stream | बूलियन | false | केवल Pocket TTS में स्ट्रीमिंग |
cfg_coef | फ़्लोट | 2.0 | केवल 1.6B में classifier-free guidance |
उत्तर: ऑडियो फ़ाइल (audio/wav)
OpenAI आवाज़ के उपनाम
| OpenAI आवाज़ | Pocket TTS | TTS 1.6B |
|---|---|---|
alloy | alba | alba |
echo | marius | vctk-p225 |
fable | cosette | expresso-खुश |
onyx | javert | vctk-p226 |
nova | fantine | alba-घोषक |
shimmer | eponine | alba-व्यापारी |
आवाज़ सूची
एंडपॉइंट: GET /v1/voices
स्वास्थ्य जाँच
एंडपॉइंट: GET /health
प्लगइन कॉन्फ़िगरेशन
Pocket TTS
सेटिंग > प्लगइन > Kyutai TTS में चालू करें। प्लगइन फ़ाइल: plugins/kyutai-tts.json
{
"id": "kyutai-tts",
"name": "Kyutai TTS",
"type": "tts",
"endpoint": "http://localhost:8200/v1/audio/speech",
"capabilities": {
"tts": {
"config": {
"voices": [
"Alba",
"Marius",
"Javert",
"Jean",
"Fantine",
"Cosette",
"Eponine",
"Azelma"
],
"default_voice": "Alba",
"supports_streaming": true,
"no_auth_required": true
}
}
}
}
TTS 1.6B
सेटिंग > प्लगइन > Kyutai TTS 1.6B में चालू करें। प्लगइन फ़ाइल: plugins/kyutai-tts-1.6b.json
{
"id": "kyutai-tts-1.6b",
"name": "Kyutai TTS 1.6B",
"type": "tts",
"endpoint": "http://localhost:8201/v1/audio/speech",
"capabilities": {
"tts": {
"config": {
"voices": [
"Alba",
"Alba-Casual",
"Alba-Merchant",
"Alba-Announcer",
"Expresso-Happy",
"Expresso-Sad",
"Expresso-Angry",
"VCTK-P225",
"VCTK-P226"
],
"default_voice": "Alba",
"supports_streaming": true,
"no_auth_required": true
}
}
}
}
नेटवर्क पहुँच
# Start server on all interfaces
python server.py --host 0.0.0.0
# Access from another machine
curl http://192.168.1.100:8200/v1/audio/speech ...
{
"endpoint": "http://192.168.1.100:8200/v1/audio/speech"
}
समस्या निवारण
मॉडल डाउनलोड Fails
# Set token for gated models
export HF_TOKEN=hf_...
CUDA बाहर of Memory
- अन्य GPU applications बंद करें
cfg_coef=1.5आज़माएँ- CPU Pocket TTS उपयोग करें
ऑडियो गुणवत्ता इश्यू
- Robotic sound: दूसरा आवाज़
- Cut बंद ऑडियो: पाठ लंबा, सर्वर खंड
- Wrong pronunciation: अंग्रेज़ी/French optimized
MPS (Apple Silicon) इश्यू
RuntimeError: MPS backend error
python server.py --device cpu
Qwen3-TTS से तुलना
| सुविधा | Kyutai Pocket | Kyutai 1.6B | Qwen3-TTS |
|---|---|---|---|
| पैरामीटर | 100M | 1.6B | 0.6B-1.7B |
| GPU आवश्यक | नहीं | वैकल्पिक | हाँ |
| भाषाएँ | अंग्रेज़ी | EN/FR | 10 भाषाएँ |
| आवाज़ क्लोनिंग | हाँ | हाँ | हाँ |
| आवाज़ डिज़ाइन | नहीं | नहीं | हाँ |
| पोर्ट | 8200 | 8201 | 8100 |
सरल अंग्रेज़ी उपयोग के लिए Kyutai और बहुभाषी सहायता व आवाज़ डिज़ाइन के लिए Qwen3-TTS चुनें।
संसाधन
- Kyutai TTS — आधिकारिक पृष्ठ
- Pocket TTS GitHub — CPU मॉडल
- Delayed Streams Modeling — 1.6B मॉडल
- आवाज़ संग्रह — उपलब्ध voices
- मॉडल कार्ड — तकनीकी विवरण