मुख्य कंटेंट तक स्किप करें

Kyutai TTS एकीकरण

Kyutai TTS मॉडल स्थानीय चलाएँ। गाइड Libre WebUI के OpenAI-compatible servers के साथ Pocket TTS (CPU) और TTS 1.6B (GPU) कवर करता है।

अवलोकन

मॉडलपैरामीटरडिवाइसउपयुक्त
Pocket TTS100Mकेवल CPULaptop, कम संसाधन
TTS 1.6B1.6BGPU/MPS/CPUसर्वर, उच्च गुणवत्ता

दोनों CALM (Continuous ऑडियो भाषा मॉडल) और ऑडियो sample से आवाज़ क्लोनिंग समर्थन करते हैं।

Pocket TTS (CPU)

CPU पर real-समय हल्का TTS, GPU नहीं।

आवश्यकताएँ

Componentन्यूनतम
Python3.10 - 3.14
PyTorch2.5+
RAM4GB
Disk500MB

त्वरित शुरुआत

cd examples/kyutai-tts-server

# Create virtual environment
python3 -m venv venv
source venv/bin/activate

# Install dependencies
pip install -r requirements.txt

# Start server
python server.py

सर्वर http://localhost:8200

परीक्षण

curl http://localhost:8200/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{"model": "kyutai-tts", "input": "Hello, welcome to Libre WebUI!", "voice": "alba"}' \
--output speech.wav

आवाज़ें

आवाज़विवरण
Albaमहिला, स्पष्ट/प्राकृतिक
Mariusपुरुष, गर्म
Javertपुरुष, प्रभावी
Jeanपुरुष, नरम
Fantineमहिला, मुलायम
Cosetteमहिला, युवा
Eponineमहिला, अभिव्यंजक
Azelmaमहिला, उज्ज्वल

प्रदर्शन

  • MacBook Air M4 पर ~6x real-समय
  • पहला खंड ~200ms
  • केवल 2 CPU cores

TTS 1.6B (GPU)

GPU acceleration और स्वचालित CUDA > MPS > CPU चयन।

आवश्यकताएँ

Componentन्यूनतमअनुशंसित
Python3.10+3.12
GPU VRAM6GB8GB+
RAM8GB16GB+
Disk4GB8GB

प्लेटफ़ॉर्म समर्थन

PlatformबैकएंडNotes
NVIDIA GPUCUDAसर्वोत्तम, bfloat16
Apple SiliconMPSfloat16
CPUPyTorchधीमा, float32

त्वरित शुरुआत

cd examples/kyutai-tts-1.6b-server

# Create virtual environment
python3 -m venv venv
source venv/bin/activate

# Install PyTorch with CUDA (for NVIDIA GPUs)
pip install torch --index-url https://download.pytorch.org/whl/cu121

# Install dependencies
pip install -r requirements.txt

# Start server (auto-detects GPU)
python server.py

सर्वर http://localhost:8201

डिवाइस चयन

# Auto-detect (CUDA > MPS > CPU)
python server.py

# Force specific device
python server.py --device cuda
python server.py --device mps
python server.py --device cpu

परीक्षण

curl http://localhost:8201/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{"model": "kyutai-tts-1.6b", "input": "Hello from the GPU!", "voice": "alba"}' \
--output speech.wav

आवाज़ें

Alba MacKenna (CC BY 4.0):

आवाज़Style
alba / alba-casualअनौपचारिक
alba-merchantव्यापारी
alba-announcerघोषक

Expresso (CC BY-NC 4.0 — गैर-व्यावसायिक):

आवाज़Emotion
expresso-happyखुश
expresso-sadउदास
expresso-angryक्रोधित

VCTK (CC BY 4.0):

  • vctk-p225, vctk-p226, vctk-p227, vctk-p228

आवाज़ क्लोनिंग

Pocket TTS

# From local file
curl http://localhost:8200/v1/audio/voice-clone \
-F "input=Hello from a cloned voice" \
-F "reference_audio=@my_voice.wav" \
--output cloned.wav

# From HuggingFace URL
curl http://localhost:8200/v1/audio/voice-clone-url \
-H "Content-Type: application/json" \
-d '{
"input": "Hello world!",
"voice_url": "hf://kyutai/tts-voices/alba-mackenna/casual.wav"
}' \
--output speech.wav

TTS 1.6B

किसी HuggingFace आवाज़ पथ को voice दें:

curl http://localhost:8201/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{
"model": "kyutai-tts-1.6b",
"input": "Custom voice synthesis",
"voice": "hf://kyutai/tts-voices/vctk/p230.wav"
}' \
--output speech.wav

API संदर्भ

Speech जनरेशन

एंडपॉइंट: POST /v1/audio/speech

{
"model": "kyutai-tts",
"input": "Text to convert to speech",
"voice": "alba",
"response_format": "wav",
"stream": false
}
पैरामीटरप्रकारडिफ़ॉल्टविवरण
modelस्ट्रिंगबदलता हैkyutai-tts या kyutai-tts-1.6b
inputस्ट्रिंगआवश्यकसंश्लेषित पाठ, अधिकतम 10,000 अक्षर
voiceस्ट्रिंगalbaआवाज़ का नाम या HuggingFace पथ
response_formatस्ट्रिंगwavऑडियो प्रारूप, केवल wav समर्थित
streamबूलियनfalseकेवल Pocket TTS में स्ट्रीमिंग
cfg_coefफ़्लोट2.0केवल 1.6B में classifier-free guidance

उत्तर: ऑडियो फ़ाइल (audio/wav)

OpenAI आवाज़ के उपनाम

OpenAI आवाज़Pocket TTSTTS 1.6B
alloyalbaalba
echomariusvctk-p225
fablecosetteexpresso-खुश
onyxjavertvctk-p226
novafantinealba-घोषक
shimmereponinealba-व्यापारी

आवाज़ सूची

एंडपॉइंट: GET /v1/voices

स्वास्थ्य जाँच

एंडपॉइंट: GET /health


प्लगइन कॉन्फ़िगरेशन

Pocket TTS

सेटिंग > प्लगइन > Kyutai TTS में चालू करें। प्लगइन फ़ाइल: plugins/kyutai-tts.json

{
"id": "kyutai-tts",
"name": "Kyutai TTS",
"type": "tts",
"endpoint": "http://localhost:8200/v1/audio/speech",
"capabilities": {
"tts": {
"config": {
"voices": [
"Alba",
"Marius",
"Javert",
"Jean",
"Fantine",
"Cosette",
"Eponine",
"Azelma"
],
"default_voice": "Alba",
"supports_streaming": true,
"no_auth_required": true
}
}
}
}

TTS 1.6B

सेटिंग > प्लगइन > Kyutai TTS 1.6B में चालू करें। प्लगइन फ़ाइल: plugins/kyutai-tts-1.6b.json

{
"id": "kyutai-tts-1.6b",
"name": "Kyutai TTS 1.6B",
"type": "tts",
"endpoint": "http://localhost:8201/v1/audio/speech",
"capabilities": {
"tts": {
"config": {
"voices": [
"Alba",
"Alba-Casual",
"Alba-Merchant",
"Alba-Announcer",
"Expresso-Happy",
"Expresso-Sad",
"Expresso-Angry",
"VCTK-P225",
"VCTK-P226"
],
"default_voice": "Alba",
"supports_streaming": true,
"no_auth_required": true
}
}
}
}

नेटवर्क पहुँच

# Start server on all interfaces
python server.py --host 0.0.0.0

# Access from another machine
curl http://192.168.1.100:8200/v1/audio/speech ...
{
"endpoint": "http://192.168.1.100:8200/v1/audio/speech"
}

समस्या निवारण

मॉडल डाउनलोड Fails

# Set token for gated models
export HF_TOKEN=hf_...

CUDA बाहर of Memory

  1. अन्य GPU applications बंद करें
  2. cfg_coef=1.5 आज़माएँ
  3. CPU Pocket TTS उपयोग करें

ऑडियो गुणवत्ता इश्यू

  • Robotic sound: दूसरा आवाज़
  • Cut बंद ऑडियो: पाठ लंबा, सर्वर खंड
  • Wrong pronunciation: अंग्रेज़ी/French optimized

MPS (Apple Silicon) इश्यू

RuntimeError: MPS backend error
python server.py --device cpu

Qwen3-TTS से तुलना

सुविधाKyutai PocketKyutai 1.6BQwen3-TTS
पैरामीटर100M1.6B0.6B-1.7B
GPU आवश्यकनहींवैकल्पिकहाँ
भाषाएँअंग्रेज़ीEN/FR10 भाषाएँ
आवाज़ क्लोनिंगहाँहाँहाँ
आवाज़ डिज़ाइननहींनहींहाँ
पोर्ट820082018100

सरल अंग्रेज़ी उपयोग के लिए Kyutai और बहुभाषी सहायता व आवाज़ डिज़ाइन के लिए Qwen3-TTS चुनें।


संसाधन