LongCat AudioDiT-integratie
Libre WebUI bevat een JSON-plugin en lokale HTTP-adapter voor meituan-longcat/LongCat-AudioDiT-1B en meituan-longcat/LongCat-AudioDiT-3.5B. De upstream biedt Python API; examples/longcat-audiodit-server levert modelontdekking, JSON-spraak en multipart stemklonen.
AudioDiT retourneert volledige 24 kHz mono WAV, geen stream. Libre splitst langere antwoorden op zinsgrenzen, genereert een begrensd aantal batches vooruit en plant audio op volgorde.
Vereisten
NVIDIA CUDA GPU is praktisch. Begin met 1B; 3.5B vereist veel meer VRAM en laadt langer. CPU is experimenteel.
Adapter starten
git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0
Luistert op 127.0.0.1:8300, zonder authenticatie voor lokaal gebruik. Stel niet bloot aan onbetrouwbare netwerken. Gebruik een geauthenticeerde HTTPS-gateway tussen hosts; herbruikbare stemmen sturen de ontsleutelde referentie per batch. Zie examples/longcat-audiodit-server/README.md.
Plugin inschakelen
Open Instellingen → Plugins → LongCat AudioDiT. Ontdekking toont alleen het geladen checkpoint; herstart om te wisselen.
Met llama-swap configureer Models API Endpoint als GET /v1/models, niet POST /v1/audio/speech; anders kan fallback een niet-geladen model selecteerbaar maken.
Kies LongCat in Instellingen → Tekst-naar-spraak. Natuurlijke batching staat aan. De providerlimiet van 140 tekens houdt dicht Chinees binnen de korte 1B-duur; langer wordt opgesplitst.
Stemklonen
Open Imagine → Audio, selecteer LongCat en Kloon een referentiestem. Upload schone opname en exacte transcriptie. Eén spreker, 3–10 seconden; boven 15 seconden of 10 MiB geweigerd.
Gebruik eenmaal of sla privé op met expliciete toestemming. Opgeslagen stemmen zijn voor hetzelfde model beschikbaar en worden in batches hergebruikt.
De referentie gebruikt duur. Past het niet, dan volgt een duidelijke clientfout in plaats van afkappen.
Kloon alleen met toestemming. Eenmalige referentie blijft in geheugen en tijdelijk bestand wordt verwijderd. Opslaan bewaart originele audio en transcriptie AES-GCM-versleuteld per gebruiker; gegenereerde imitatie vervangt nooit de bron. Geen draagbare speakerembedding, dus de bron wordt per batch ontsleuteld en verzonden. Profiel kan permanent worden verwijderd en faalt veilig na routewijziging.
Gegenereerde spraak staat apart in de versleutelde galerij. Verwijderen van resultaat of profiel beïnvloedt het andere niet.
WAV, FLAC, MP3 en Ogg worden ondersteund. Engels en Mandarijn zijn het sterkst gedocumenteerd. Geen benoemde presets; gewone synthese gebruikt modelstandaard.
Inferentie-instellingen
Begrensde variabelen voor ODE-stappen, guidance, CFG/APG en seed. Alleen manifestinstellingen worden verzonden. AudioDiT ondersteunt geen snelheid; speed van 0.25 tot 4.0 wordt voor OpenAI-compatibiliteit geaccepteerd maar genegeerd.
Zie README voor curl, Docker, limieten en offlinevalidatie.