Passa al contenuto principale

Integrazione LongCat AudioDiT

Libre WebUI include un plugin JSON e un adattatore HTTP locale per i checkpoint ufficiali meituan-longcat/LongCat-AudioDiT-1B e meituan-longcat/LongCat-AudioDiT-3.5B. Poiché il progetto a monte offre una API Python, l'adattatore in examples/longcat-audiodit-server fornisce scoperta modelli, voce JSON ed endpoint multipart di clonazione.

AudioDiT restituisce file WAV mono completi a 24 kHz invece di streaming. Libre WebUI divide quindi le risposte lunghe ai confini di frasi e proposizioni, genera in anticipo un numero limitato di batch e pianifica l'audio decodificato in ordine.

Requisiti

Una GPU NVIDIA CUDA è l'obiettivo pratico. Inizia dal checkpoint 1B; il 3.5B richiede molta più VRAM e più tempo. La CPU è disponibile per esperimenti ma difficilmente è interattiva.

Avviare l'adattatore

git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0

Il server ascolta su 127.0.0.1:8300. È intenzionalmente privo di autenticazione per uso locale: non esporlo a reti non affidabili. Usa un gateway HTTPS autenticato tra host diversi; le voci riutilizzabili inviano la registrazione decifrata per ogni batch. L'esempio CUDA Docker e il controllo sono in examples/longcat-audiodit-server/README.md.

Abilitare il plugin

Apri Impostazioni → Plugin → LongCat AudioDiT, attivalo e lascia gli endpoint locali salvo adattatore remoto. La scoperta mostra solo il checkpoint residente. Riavvia per passare tra 1B e 3.5B.

Con un gateway come llama-swap, configura Models API Endpoint sulla rotta GET /v1/models dell'adattatore. Non puntare a POST /v1/audio/speech: il fallimento ricade sui due checkpoint del manifesto e può rendere selezionabile un modello non caricato.

Usa Impostazioni → Sintesi vocale per selezionare LongCat. La riproduzione naturale in batch è attiva. Il limite condiviso di 140 caratteri mantiene il cinese denso nella finestra breve del modello 1B; le risposte più lunghe vengono divise.

Clonazione vocale

Apri Imagine → Audio, seleziona LongCat e attiva Clona una voce di riferimento. Carica una registrazione pulita e trascrivi esattamente le parole. Funziona meglio un singolo parlante di 3–10 secondi; oltre 15 secondi o 10 MiB viene rifiutato.

Può essere una generazione singola o una voce salvata con nome privato e consenso esplicito. Le voci salvate sono selezionabili per lo stesso modello e vengono riutilizzate nei batch.

La reference occupa parte della finestra di durata. Se il testo non entra, l'adattatore restituisce un errore chiaro invece di troncare; abbrevia.

Clona soltanto con autorizzazione. Per uso singolo, la reference resta in memoria e il file temporaneo viene rimosso. Salvando, audio originale e trascrizione sono in un profilo AES-GCM dell'utente; l'imitazione generata non sostituisce mai l'originale. AudioDiT non offre embedding portabile, quindi la coppia viene decifrata e inviata a ogni batch. Puoi eliminare il profilo. Se percorso o endpoint approvato cambia, fallisce in modo sicuro e va ricreato.

La voce generata è separata nella galleria cifrata. Eliminare un risultato non elimina il profilo, né il contrario.

Sono supportati WAV, FLAC, MP3 e Ogg. Inglese e mandarino sono i target meglio documentati. Non ci sono voci predefinite con nome: la sintesi usa il default.

Controlli di inferenza

Il plugin espone variabili limitate per passi ODE, intensità, metodo CFG/APG e seed. Solo i controlli dichiarati vengono inviati. I default corrispondono all'esempio a monte.

AudioDiT non controlla la velocità. Per compatibilità OpenAI, accetta speed da 0.25 a 4.0 e lo ignora intenzionalmente. Il modello determina il ritmo; non viene applicato time-stretch.

Consulta il README per richieste curl, Docker, limiti e convalida offline.