Ana içeriğe geç

LongCat AudioDiT Entegrasyonu

Libre WebUI, resmi meituan-longcat/LongCat-AudioDiT-1B ve meituan-longcat/LongCat-AudioDiT-3.5B denetim noktaları için JSON eklentisi ve yerel HTTP bağdaştırıcısı içerir. Üst proje HTTP sunucusu yerine Python API verdiğinden examples/longcat-audiodit-server, model keşfi, JSON konuşma ve multipart ses klonlama uçları sağlar.

AudioDiT akış yerine tam 24 kHz mono WAV döndürür. Libre uzun yanıtları cümle ve deyim sınırlarında böler, sınırlı paketleri önceden üretir ve kesintisiz çalma için sırayla zamanlar.

Gereksinimler

Pratik hedef NVIDIA CUDA GPU’dur. 1B ile başlayın; 3.5B çok daha fazla VRAM ve yükleme süresi ister. CPU deney için vardır fakat etkileşimli olması beklenmez.

Bağdaştırıcıyı Başlatma

git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0

Sunucu varsayılan olarak 127.0.0.1:8300 adresine bağlanır ve yerel kullanım için kimlik doğrulamasızdır; güvenilmeyen ağa açmayın. Farklı ana bilgisayarlarda kimliği doğrulanmış HTTPS ağ geçidi kullanın: yeniden kullanılabilir sesler her Konuşma paketinde çözülmüş referans kaydı bu uca yollar. CUDA Docker örneği ve sağlık kontrolü examples/longcat-audiodit-server/README.md içindedir.

Eklentiyi Etkinleştirme

Ayarlar → Eklentiler → LongCat AudioDiT üzerinden etkinleştirin ve bağdaştırıcı başka yerde değilse yerel uçları bırakın. Keşif yalnızca süreçte yüklü denetim noktasını duyurur. 1B/3.5B geçişinde bağdaştırıcıyı yeniden başlatın.

llama-swap gibi bir ağ geçidinde Modeller API Uç Noktası değerini ağ geçidi üzerinden GET /v1/models olarak ayarlayın. Keşfi POST /v1/audio/speech noktasına yöneltmeyin; başarısız keşif iki manifest modeline döner ve yüklü olmayan modeli seçtirebilir.

Ayarlar → Metinden Konuşmaya bölümünde LongCat’i seçin. Doğal toplu çalma varsayılan açıktır. Ortak 140 karakter sınırı yoğun Çinceyi 1B süresine sığdırır; uzun yanıtlar otomatik paketlenir.

Ses Klonlama

Imagine → Ses bölümünde LongCat modeli seçip Referans sesi klonla seçeneğini açın. Temiz kayıt ve söylenen tam metni girin. 3–10 saniyelik tek konuşmacı ve az gürültü en iyisidir; 15 saniye veya 10 MiB üzeri reddedilir.

Tek seferlik üretim olarak kalabilir veya özel adla yeniden kullanılabilir kaydedilip konuşmacının saklamaya onayı açıkça doğrulanabilir. Kaydedilen ses aynı model için ayarlarda görünür ve sohbet okumaları cümle duyarlı paketlerde kullanır.

Referans süre penceresinin bir bölümünü kullanır. İstenen konuşma kalana sığmazsa bağdaştırıcı sessizce kırpmak yerine açık hata döndürür; referansı veya metni kısaltın.

Yalnızca açık izinle klonlayın. Tek seferlikte Libre referansı bellekte tutar ve bağdaştırıcı geçici dosyayı siler. Kaydetmede özgün ses ve tam transkript kullanıcı kapsamlı AES-GCM şifreli profile yazılır; üretilen taklit kanonik referans olmaz. AudioDiT taşınabilir konuşmacı gömmesi sunmadığından özgün çift her pakette çözülüp sağlayıcıya gider. Profil kalıcı silinebilir. Onaylı rota veya uç değişirse güvenli biçimde kapanır; yeni hedefi doğrulayıp yeniden oluşturun.

Üretilen konuşma şifreli medya galerisinde ayrıdır. Galeri sonucu silmek profili, profil silmek önceki sesi silmez.

WAV, FLAC, MP3 ve Ogg desteklenir. En güçlü belgelenmiş diller İngilizce ve Mandarin Çincesidir. Hazır adlandırılmış ses yoktur; normal sentez model varsayılanını kullanır.

Çıkarım Denetimleri

Eklenti ODE adımları, yönlendirme gücü, CFG/APG yöntemi ve seed için sınırlı değişkenler sunar. Libre yalnızca manifestte bildirilenleri konuşma ve klonlama uçlarına yollar. Varsayılanlar üst örnekle eşleşir.

AudioDiT hız denetimi sunmaz. OpenAI biçimiyle uyum için speed değerlerini 0.254.0 kabul edip bilinçli yok sayar. Zamanlamayı model belirler; WAV esnetilmez.

Doğrudan curl, Docker, kesin sınırlar ve çevrimdışı doğrulama için örnek README’ye bakın.