Integracja LongCat AudioDiT
Plugin JSON i adapter HTTP dla meituan-longcat/LongCat-AudioDiT-1B i meituan-longcat/LongCat-AudioDiT-3.5B. Adapter examples/longcat-audiodit-server dodaje wykrywanie, JSON i multipart.
AudioDiT zwraca pełny WAV mono 24 kHz; Libre dzieli na zdania, generuje ograniczone partie i odtwarza kolejno.
Wymagania
Praktycznie NVIDIA CUDA. Zacznij od 1B; 3.5B wymaga więcej VRAM. CPU eksperymentalnie.
Uruchomienie
git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0
Domyślnie 127.0.0.1:8300, bez uwierzytelniania lokalnego — nie wystawiaj. Między hostami użyj HTTPS; zapisany głos wysyła odszyfrowaną próbkę każdej partii. Zobacz examples/longcat-audiodit-server/README.md.
Plugin
Aktywuj Ustawienia → Pluginy → LongCat AudioDiT. Wykrywanie pokazuje tylko załadowany checkpoint. Przy llama-swap Models API Endpoint ustaw na GET /v1/models, nie POST /v1/audio/speech.
Wybierz w Ustawienia → TTS. Limit 140 znaków utrzymuje chiński w oknie 1B; dłuższe jest dzielone.
Klonowanie
Imagine → Audio, czysta próbka i dokładna transkrypcja. 3–10 sekund, jedna osoba; ponad 15 s/10 MiB odrzucone. Można użyć raz lub zapisać prywatnie po zgodzie. Referencja zajmuje czas; przy braku miejsca błąd zamiast obcięcia.
Jednorazowa próbka jest w pamięci; zapisana para jest AES-GCM per użytkownik. Imitacja nie zastępuje źródła. Brak przenośnego embeddingu, więc źródło jest wysyłane każdej partii. Zmiana trasy powoduje bezpieczną porażkę. Galeria i profil są niezależne.
Obsługiwane WAV, FLAC, MP3, Ogg; najmocniej angielski i mandaryński. Brak nazwanych presetów.
Sterowanie
Bezpośrednie żądania curl opisano w README.
Ograniczone ODE, guidance, CFG/APG, seed. speed 0.25–4.0 jest akceptowane dla zgodności OpenAI, lecz ignorowane. Szczegóły w README.