Integrace LongCat AudioDiT
Libre WebUI obsahuje JSON plugin a místní HTTP adaptér pro oficiální kontrolní body meituan-longcat/LongCat-AudioDiT-1B a meituan-longcat/LongCat-AudioDiT-3.5B. Upstream projekt poskytuje API Python místo HTTP serveru, proto adaptér v examples/longcat-audiodit-server zajišťuje zjišťování modelů, řeč JSON a multipart endpointy pro klonování hlasu.
AudioDiT vrací úplné mono soubory WAV 24 kHz místo streamované zvukové odpovědi. Libre WebUI proto dělí delší odpovědi na hranicích vět a frází, předem generuje omezený počet dávek a plánuje dekódovaný zvuk v pořadí pro plynulé přehrávání.
Požadavky
Praktickým cílem je GPU NVIDIA CUDA. Začněte kontrolním bodem 1B; 3.5B vyžaduje podstatně více VRAM a načítá se déle. CPU lze použít pro experimenty, ale nejspíš nebude interaktivní.
Spuštění adaptéru
Naklonujte oficiální implementaci a vytvořte izolované prostředí:
git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
Poté spusťte jeden kontrolní bod:
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0
Server se ve výchozím stavu váže na 127.0.0.1:8300. Pro místní použití záměrně nemá ověřování, proto jej nevystavujte nedůvěryhodné síti. Pokud Libre WebUI a adaptér běží na různých hostitelích, použijte ověřovanou bránu HTTPS: opakovaně použitelné hlasy odesílají dešifrovanou referenční nahrávku endpointu pro každou dávku řeči. Příklad CUDA Docker a kontrola stavu jsou v examples/longcat-audiodit-server/README.md.
Zapnutí pluginu
Otevřete Nastavení → Pluginy → LongCat AudioDiT, aktivujte jej a ponechte místní výchozí endpointy, pokud adaptér neběží jinde. Zjišťování modelů oznamuje pouze kontrolní bod v daném serverovém procesu. Přepnutí mezi 1B a 3.5B vyžaduje restart adaptéru.
Pokud je před adaptérem brána jako llama-swap, nastavte endpoint API modelů na trasu adaptéru GET /v1/models přes tuto bránu. Zjišťování modelů nesměřujte na POST /v1/audio/speech: při selhání se použijí oba kontrolní body manifestu a UI může zvolit bod, který adaptér nenačetl.
V Nastavení → Text na řeč zvolte LongCat pro přehrávání chatu. Přirozené dávkové přehrávání je ve výchozím stavu zapnuté. Sdílený limit poskytovatele 140 znaků udržuje hustý čínský text v kratším časovém okně 1B; Libre WebUI pro delší odpovědi automaticky vytvoří více dávek.
Klonování hlasu
Otevřete Tvorba → Zvuk, vyberte řečový model LongCat a zapněte Klonovat referenční hlas. Nahrajte čistou nahrávku a zadejte přesná vyslovená slova. Nejlépe funguje 3–10sekundový klip jednoho mluvčího s malým šumem; adaptér odmítá klipy nad 15 sekund nebo 10 MiB.
Klonování může být jednorázové, nebo zvolte Uložit jako opakovaně použitelný hlas, přidejte soukromý název a výslovně potvrďte souhlas mluvčího s uložením. Uložené hlasy lze zvolit pro stejný model v Nastavení → Text na řeč. Předčítání a automatické přehrávání pak hlas znovu používá v dávkách Libre WebUI rozlišujících věty.
Reference spotřebuje část časového okna AudioDiT. Pokud se požadovaná řeč nevejde, adaptér vrátí jasnou klientskou chybu místo tichého oříznutí. Zkraťte referenci nebo text a zkuste to znovu.
Hlas klonujte pouze s výslovným souhlasem mluvčího. U jednorázového generování Libre WebUI drží referenci v paměti a adaptér po požadavku odstraní dočasný dekódovací soubor. Při uložení opakovaně použitelného hlasu se původní zvuk a přesný přepis uloží do uživatelsky omezeného profilu šifrovaného AES-GCM. Vygenerovaná imitace nikdy nenahrazuje kanonickou referenci. AudioDiT neposkytuje přenosné vkládání mluvčího, proto se původní dvojice dešifruje a posílá poskytovateli pro každou dávku. Profil lze trvale smazat. Při změně schváleného směrování nebo endpointu se bezpečně odmítne; po ověření cíle jej vytvořte znovu.
Vygenerovaná řeč se ukládá odděleně v šifrované mediální galerii uživatele. Smazání výsledku nesmaže hlasový profil a smazání profilu neodstraní dříve vygenerovaný zvuk.
Poskytovatel podporuje reference WAV, FLAC, MP3 a Ogg. Nejlépe dokumentovanými jazyky jsou angličtina a mandarínská čínština. LongCat nezveřejňuje pojmenované přednastavené hlasy, běžná syntéza proto používá výchozí hlas modelu.
Ovládání inference
Plugin nabízí omezené pokročilé proměnné pro kroky ODE, sílu vedení, metodu CFG/APG a seed. Libre WebUI předává endpointům řeči a klonování pouze ovládací prvky deklarované v manifestu. Výchozí hodnoty odpovídají upstream příkladu inference a jsou vhodným začátkem.
AudioDiT nenabízí ovládání rychlosti přehrávání. Pro kompatibilitu s požadavkem OpenAI adaptér přijímá speed od 0.25 do 4.0, ale záměrně je ignoruje. Skutečné časování určuje model; jiná rychlost vygenerovaný WAV časově neroztáhne.
Přímé požadavky curl, příkazy Docker, přesné limity a offline ověření najdete v README příkladu.