Ana içeriğe geç

Kyutai TTS Entegrasyonu

Kyutai TTS modellerini yerel çalıştırın. Bu kılavuz Libre WebUI içindeki OpenAI uyumlu sunucularla Pocket TTS (CPU) ve TTS 1.6B (GPU) modellerini kapsar.

Genel Bakış

ModelParametreAygıtEn Uygun
Pocket TTS100MYalnız CPUDizüstü ve düşük kaynak
TTS 1.6B1.6BGPU/MPS/CPUSunucu ve yüksek kaliteli sentez

İkisi de CALM (Continuous Audio Language Models) kullanır ve ses örneğinden klonlamayı destekler.

Pocket TTS (CPU)

GPU gerektirmeden CPU’da gerçek zamanlı çalışan hafif TTS.

Gereksinimler

BileşenAsgari
Python3.10 - 3.14
PyTorch2.5+
RAM4GB
Disk500MB

Hızlı Başlangıç

cd examples/kyutai-tts-server

# Create virtual environment
python3 -m venv venv
source venv/bin/activate

# Install dependencies
pip install -r requirements.txt

# Start server
python server.py

Sunucu http://localhost:8200 adresindedir.

Test

curl http://localhost:8200/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{"model": "kyutai-tts", "input": "Hello, welcome to Libre WebUI!", "voice": "alba"}' \
--output speech.wav

Sesler

SesAçıklama
AlbaKadın, açık ve doğal
MariusErkek, sıcak
JavertErkek, otoriter
JeanErkek, yumuşak
FantineKadın, yumuşak
CosetteKadın, genç
EponineKadın, ifadeli
AzelmaKadın, parlak

Performans

  • MacBook Air M4’te yaklaşık 6x gerçek zaman
  • İlk ses parçasına yaklaşık 200ms
  • Yalnız 2 CPU çekirdeği

TTS 1.6B (GPU)

GPU hızlandırmalı yüksek kalite. Otomatik seçim: CUDA > MPS > CPU.

Gereksinimler

BileşenAsgariÖnerilen
Python3.10+3.12
GPU VRAM6GB8GB+
RAM8GB16GB+
Disk4GB8GB

Platform Desteği

PlatformBackendNotlar
NVIDIA GPUCUDAEn iyi performans, bfloat16
Apple SiliconMPSfloat16
CPUPyTorchDaha yavaş, float32

Hızlı Başlangıç

cd examples/kyutai-tts-1.6b-server

# Create virtual environment
python3 -m venv venv
source venv/bin/activate

# Install PyTorch with CUDA (for NVIDIA GPUs)
pip install torch --index-url https://download.pytorch.org/whl/cu121

# Install dependencies
pip install -r requirements.txt

# Start server (auto-detects GPU)
python server.py

Sunucu http://localhost:8201 adresindedir.

Aygıt Seçimi

# Auto-detect (CUDA > MPS > CPU)
python server.py

# Force specific device
python server.py --device cuda
python server.py --device mps
python server.py --device cpu

Test

curl http://localhost:8201/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{"model": "kyutai-tts-1.6b", "input": "Hello from the GPU!", "voice": "alba"}' \
--output speech.wav

Sesler

Alba MacKenna (CC BY 4.0):

SesTarz
alba / alba-casualGündelik konuşma
alba-merchantTüccar karakteri
alba-announcerSpiker tarzı

Expresso (CC BY-NC 4.0 — ticari olmayan):

SesDuygu
expresso-happyMutlu
expresso-sadÜzgün
expresso-angryKızgın

VCTK (CC BY 4.0):

  • vctk-p225, vctk-p226, vctk-p227, vctk-p228

Ses Klonlama

İki sunucu da ses dosyalarından klonlar.

Pocket TTS

# From local file
curl http://localhost:8200/v1/audio/voice-clone \
-F "input=Hello from a cloned voice" \
-F "reference_audio=@my_voice.wav" \
--output cloned.wav

# From HuggingFace URL
curl http://localhost:8200/v1/audio/voice-clone-url \
-H "Content-Type: application/json" \
-d '{
"input": "Hello world!",
"voice_url": "hf://kyutai/tts-voices/alba-mackenna/casual.wav"
}' \
--output speech.wav

TTS 1.6B

Her HuggingFace ses yolunu voice olarak verin:

curl http://localhost:8201/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{
"model": "kyutai-tts-1.6b",
"input": "Custom voice synthesis",
"voice": "hf://kyutai/tts-voices/vctk/p230.wav"
}' \
--output speech.wav

API Başvurusu

Konuşma Üretimi

Uç: POST /v1/audio/speech

{
"model": "kyutai-tts",
"input": "Text to convert to speech",
"voice": "alba",
"response_format": "wav",
"stream": false
}
ParametreTürVarsayılanAçıklama
modelstringdeğişirkyutai-tts veya kyutai-tts-1.6b
inputstringgerekliEn çok 10,000 karakter
voicestringalbaSes adı veya HuggingFace yolu
response_formatstringwavYalnız wav
streambooleanfalseYalnız Pocket TTS akışı
cfg_coeffloat2.0Yalnız 1.6B sınıflandırıcısız yönlendirme

Yanıt: Ses dosyası (audio/wav)

OpenAI Ses Takma Adları

OpenAI SesiPocket TTSTTS 1.6B
alloyalbaalba
echomariusvctk-p225
fablecosetteexpresso-happy
onyxjavertvctk-p226
novafantinealba-announcer
shimmereponinealba-merchant

Sesleri Listeleme

Uç: GET /v1/voices

Sağlık Kontrolü

Uç: GET /health


Eklenti Yapılandırması

Pocket TTS

Ayarlar > Eklentiler > Kyutai TTS içinde etkinleştirin.

Dosya: plugins/kyutai-tts.json

{
"id": "kyutai-tts",
"name": "Kyutai TTS",
"type": "tts",
"endpoint": "http://localhost:8200/v1/audio/speech",
"capabilities": {
"tts": {
"config": {
"voices": [
"Alba",
"Marius",
"Javert",
"Jean",
"Fantine",
"Cosette",
"Eponine",
"Azelma"
],
"default_voice": "Alba",
"supports_streaming": true,
"no_auth_required": true
}
}
}
}

TTS 1.6B

Ayarlar > Eklentiler > Kyutai TTS 1.6B içinde etkinleştirin.

Dosya: plugins/kyutai-tts-1.6b.json

{
"id": "kyutai-tts-1.6b",
"name": "Kyutai TTS 1.6B",
"type": "tts",
"endpoint": "http://localhost:8201/v1/audio/speech",
"capabilities": {
"tts": {
"config": {
"voices": [
"Alba",
"Alba-Casual",
"Alba-Merchant",
"Alba-Announcer",
"Expresso-Happy",
"Expresso-Sad",
"Expresso-Angry",
"VCTK-P225",
"VCTK-P226"
],
"default_voice": "Alba",
"supports_streaming": true,
"no_auth_required": true
}
}
}
}

Ağ Erişimi

# Start server on all interfaces
python server.py --host 0.0.0.0

# Access from another machine
curl http://192.168.1.100:8200/v1/audio/speech ...
{
"endpoint": "http://192.168.1.100:8200/v1/audio/speech"
}

Sorun Giderme

Model İndirilemiyor

# Set token for gated models
export HF_TOKEN=hf_...

CUDA Belleği Yetersiz

  1. Diğer GPU uygulamalarını kapatın
  2. Daha az bellek için cfg_coef=1.5 deneyin
  3. CPU tabanlı Pocket TTS kullanın

Ses Kalitesi Sorunları

  • Robotik ses: Başka ses deneyin
  • Kesilen ses: Metin uzun olabilir; sunucu otomatik böler
  • Yanlış telaffuz: Model İngilizce ve Fransızca için iyileştirilmiştir

MPS (Apple Silicon) Sorunları

RuntimeError: MPS backend error

1.6B MPS’te float16 kullanır. Sorun sürerse CPU’yu zorlayın:

python server.py --device cpu

Qwen3-TTS ile Karşılaştırma

ÖzellikKyutai PocketKyutai 1.6BQwen3-TTS
Parametreler100M1.6B0.6B-1.7B
GPU GerekliHayırİsteğe bağlıEvet
DillerİngilizceEN/FR10 dil
Ses KlonlamaEvetEvetEvet
Ses TasarımıHayırHayırEvet
Bağlantı noktası820082018100

Basit İngilizce kullanım için Kyutai, çok dilli ve ses tasarımı için Qwen3-TTS seçin.


Kaynaklar