Zum Hauptinhalt springen

LongCat AudioDiT-Integration

Libre WebUI enthält ein JSON-Plugin und einen lokalen HTTP-Adapter für die offiziellen Prüfpunkte meituan-longcat/LongCat-AudioDiT-1B und meituan-longcat/LongCat-AudioDiT-3.5B. Das Upstream-Projekt bietet eine Python-API statt eines HTTP-Servers. Der Adapter in examples/longcat-audiodit-server stellt daher Modellermittlung, JSON-Sprachausgabe und Multipart-Stimmenklonen bereit.

AudioDiT liefert vollständige Mono-WAV-Dateien mit 24 kHz statt einer Streaming-Antwort. Libre WebUI teilt längere Antworten an Satz- und Phrasengrenzen, erzeugt eine begrenzte Zahl von Stapeln im Voraus und plant das dekodierte Audio der Reihe nach für kontinuierliche Wiedergabe.

Anforderungen

Eine NVIDIA-CUDA-GPU ist das praktische Ziel. Beginne mit 1B; 3.5B benötigt deutlich mehr VRAM und lädt länger. Eine CPU eignet sich zum Experimentieren, ist aber wahrscheinlich nicht interaktiv.

Adapter starten

Klone die offizielle Implementierung und erstelle eine isolierte Umgebung:

git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"

Starte anschließend einen Prüfpunkt:

python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0

Der Server bindet standardmäßig an 127.0.0.1:8300. Er hat absichtlich keine Authentifizierung für lokale Nutzung; stelle ihn nicht direkt einem nicht vertrauenswürdigen Netz bereit. Verwende ein authentifiziertes HTTPS-Gateway, wenn Libre WebUI und Adapter auf verschiedenen Hosts laufen: Wiederverwendbare Stimmen senden die entschlüsselte Referenzaufnahme für jeden Sprachstapel dorthin. Ein CUDA-Docker-Beispiel und die Zustandsprüfung stehen in examples/longcat-audiodit-server/README.md.

Plugin aktivieren

Öffne Einstellungen → Plugins → LongCat AudioDiT, aktiviere es und belasse die lokalen Standardendpunkte, sofern der Adapter nicht woanders läuft. Die Modellermittlung zeigt nur den im Serverprozess geladenen Prüfpunkt. Starte den Adapter neu, um zwischen 1B und 3.5B zu wechseln.

Wenn ein Gateway wie llama-swap davor liegt, konfiguriere den Modell-API-Endpunkt auf die Route GET /v1/models des Adapters über das Gateway. Richte die Ermittlung nicht auf POST /v1/audio/speech: Ein Fehler fällt auf beide Manifestprüfpunkte zurück und kann die Auswahl eines nicht geladenen Punkts erlauben.

Wähle LongCat unter Einstellungen → Text zu Sprache für die Chatwiedergabe. Natürliche Stapelwiedergabe ist standardmäßig aktiv. Das gemeinsame Anbieterlimit von 140 Zeichen hält dichten chinesischen Text im kürzeren Zeitfenster von 1B; längere Antworten werden automatisch aufgeteilt.

Stimmenklonen

Öffne Imagine → Audio, wähle ein LongCat-Sprachmodell und aktiviere Referenzstimme klonen. Lade eine saubere Aufnahme hoch und gib die gesprochenen Wörter exakt ein. Am besten funktionieren 3–10 Sekunden mit einer Person und wenig Hintergrundgeräusch; mehr als 15 Sekunden oder 10 MiB werden abgewiesen.

Das Klonen kann einmalig bleiben, oder du wählst Als wiederverwendbare Stimme speichern, vergibst einen privaten Namen und bestätigst ausdrücklich die Einwilligung. Gespeicherte Stimmen werden für dasselbe Modell unter Einstellungen → Text zu Sprache auswählbar. Vorlesen und automatische Wiedergabe verwenden sie über die satzbewussten Stapel hinweg.

Die Referenz verbraucht einen Teil des AudioDiT-Zeitfensters. Passt die angeforderte Sprache nicht in die Restzeit, gibt der Adapter einen klaren Clientfehler aus statt Audio abzuschneiden; kürze Referenz oder Text.

Klone nur mit ausdrücklicher Erlaubnis. Bei einmaliger Erzeugung bleibt die Referenz im Speicher und der Adapter löscht die temporäre Datei. Beim ausdrücklichen Speichern bewahrt Libre WebUI Originalaudio und exaktes Transkript in einem benutzerspezifischen, AES-GCM-verschlüsselten Profil auf. Die erzeugte Imitation ersetzt niemals die kanonische Referenz. AudioDiT bietet keine portable Sprecher-Einbettung; das Originalpaar wird für jeden Stapel entschlüsselt und an den Anbieter gesendet. Das Profil kann dauerhaft gelöscht werden. Es schlägt sicher fehl, wenn sich genehmigte Weiterleitung oder Endpunkt ändern; erstelle es nach Prüfung neu.

Erzeugte Sprache liegt getrennt in der verschlüsselten Mediengalerie. Das Löschen eines Galerieergebnisses entfernt nicht das Profil und umgekehrt.

Der Anbieter unterstützt WAV-, FLAC-, MP3- und Ogg-Referenzen. Englisch und Mandarin sind die am besten dokumentierten Zielsprachen. LongCat veröffentlicht keine benannten Vorgabestimmen; normale Synthese nutzt den Modellstandard.

Inferenzsteuerung

Das Plugin bietet begrenzte erweiterte Variablen für ODE-Schritte, Führungsstärke, CFG-/APG-Methode und Seed. Libre WebUI leitet nur im Manifest deklarierte Steuerungen an Sprach- und Klonendpunkt weiter. Die Vorgaben entsprechen dem Upstream-Beispiel.

AudioDiT bietet keine Geschwindigkeitssteuerung. Für OpenAI-Kompatibilität akzeptiert der Adapter speed von 0.25 bis 4.0 und ignoriert es absichtlich. Das Modell bestimmt das Tempo; eine andere Wahl dehnt die WAV nicht.

Das README enthält direkte curl-Anfragen, Docker-Befehle, genaue Grenzen und Offline-Prüfungen.