Integrasi LongCat AudioDiT
Libre WebUI menyertakan plugin JSON dan adapter HTTP lokal untuk checkpoint resmi meituan-longcat/LongCat-AudioDiT-1B dan meituan-longcat/LongCat-AudioDiT-3.5B. Proyek upstream menyediakan API Python, bukan server HTTP, sehingga adapter di examples/longcat-audiodit-server menyediakan penemuan model, ucapan JSON, dan endpoint kloning suara multipart.
AudioDiT mengembalikan berkas WAV mono 24 kHz lengkap, bukan respons audio streaming. Karena itu, Libre WebUI membagi balasan yang lebih panjang pada batas kalimat dan frasa, membuat sejumlah batch terbatas terlebih dahulu, lalu menjadwalkan audio yang telah didekode secara berurutan agar pemutaran berkelanjutan.
Persyaratan
GPU NVIDIA CUDA adalah sasaran praktis. Mulailah dengan checkpoint 1B; checkpoint 3.5B memerlukan VRAM jauh lebih besar dan membutuhkan waktu lebih lama untuk dimuat. CPU tersedia untuk eksperimen, tetapi kemungkinan tidak cukup cepat untuk penggunaan interaktif.
Memulai Adapter
Klon implementasi resmi dan buat lingkungan terisolasi:
git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
Kemudian mulai salah satu checkpoint:
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0
Secara bawaan, server terikat ke 127.0.0.1:8300. Server sengaja tidak menggunakan autentikasi untuk pemakaian lokal, jadi jangan tampilkan langsung ke jaringan yang tidak tepercaya. Gunakan gateway HTTPS terautentikasi ketika Libre WebUI dan adapter berada di host berbeda: suara yang dapat digunakan ulang mengirim rekaman referensi yang telah didekripsi ke endpoint tersebut untuk setiap batch Ucapan. Contoh Docker CUDA dan pemeriksaan kesehatan didokumentasikan dalam examples/longcat-audiodit-server/README.md.
Mengaktifkan Plugin
Buka Pengaturan → Plugin → LongCat AudioDiT, aktifkan, lalu biarkan endpoint lokal bawaan kecuali adapter berjalan di tempat lain. Penemuan model hanya mengumumkan checkpoint yang dimuat dalam proses server tersebut. Mulai ulang adapter untuk beralih antara model 1B dan 3.5B.
Jika gateway seperti llama-swap berada di depan adapter, konfigurasikan Endpoint API Model sebagai rute GET /v1/models milik adapter melalui gateway tersebut. Jangan arahkan penemuan model ke POST /v1/audio/speech: penemuan yang gagal akan kembali ke kedua checkpoint manifes dan dapat membuat UI memilih checkpoint yang tidak dimuat adapter.
Gunakan Pengaturan → Teks-ke-Ucapan untuk memilih LongCat bagi pemutaran chat. Pemutaran batch alami diaktifkan secara bawaan. Batas bersama penyedia sebanyak 140 karakter menjaga teks Mandarin yang padat tetap berada dalam jendela durasi model 1B yang lebih pendek; Libre WebUI otomatis membuat beberapa batch untuk respons yang lebih panjang.
Kloning Suara
Buka Bayangkan → Audio, pilih model ucapan LongCat, lalu aktifkan Klon suara referensi. Unggah rekaman bersih dan masukkan kata-kata yang diucapkan secara persis. Klip 3–10 detik dengan satu pembicara dan sedikit derau latar memberikan hasil terbaik; adapter menolak klip di atas 15 detik atau 10 MiB.
Kloning dapat tetap menjadi pembuatan sekali pakai, atau Anda dapat memilih Simpan sebagai suara yang dapat digunakan ulang, memberikan nama privat, dan secara eksplisit mengonfirmasi bahwa pembicara menyetujui penyimpanan. Suara tersimpan dapat dipilih untuk model LongCat yang sama di Pengaturan → Teks-ke-Ucapan. Pembacaan nyaring dan putar otomatis dalam chat kemudian menggunakan kembali suara tersebut pada batch peka-kalimat Libre WebUI.
Referensi menggunakan sebagian jendela durasi AudioDiT. Jika ucapan yang diminta tidak muat dalam sisa waktu, adapter mengembalikan kesalahan klien yang jelas alih-alih memotong audio secara diam-diam; pendekkan referensi atau teks yang dihasilkan lalu coba lagi.
Hanya klon suara dengan izin eksplisit dari pembicaranya. Untuk pembuatan sekali pakai, Libre WebUI menyimpan referensi dalam memori dan adapter menghapus berkas dekode sementara setelah permintaan. Jika Anda secara eksplisit menyimpan suara yang dapat digunakan ulang, Libre WebUI menyimpan audio referensi asli dan transkrip persisnya dalam profil yang dibatasi per pengguna serta dienkripsi AES-GCM. Libre WebUI tidak pernah mengganti referensi kanonis dengan tiruan yang dihasilkan. AudioDiT tidak menyediakan embedding pembicara portabel, sehingga pasangan asli didekripsi dan dikirim ke penyedia yang dikonfigurasi untuk setiap batch yang dibuat. Anda dapat menghapus profil secara permanen dari pengaturan Teks-ke-Ucapan. Profil tersimpan akan menolak secara aman jika perutean atau endpoint plugin yang disetujui berubah; buat ulang profil setelah memverifikasi tujuan baru.
Ucapan yang dihasilkan disimpan terpisah dalam galeri media terenkripsi milik pengguna. Menghapus hasil galeri tidak menghapus profil suara tersimpan, dan menghapus profil suara tidak menghapus audio galeri yang sudah dibuat.
Penyedia mendukung referensi WAV, FLAC, MP3, dan Ogg. Bahasa Inggris dan Mandarin adalah sasaran bahasa terdokumentasi yang paling kuat. LongCat tidak menerbitkan suara bernama bawaan, sehingga sintesis biasa menggunakan nilai bawaan model.
Kontrol Inferensi
Plugin menyediakan variabel lanjutan terbatas untuk langkah ODE, kekuatan panduan, metode panduan CFG/APG, dan seed. Libre WebUI hanya meneruskan kontrol yang dideklarasikan manifes tersebut ke endpoint ucapan dan kloning. Nilai bawaannya cocok dengan contoh inferensi upstream dan merupakan titik awal yang baik.
AudioDiT tidak menyediakan kontrol kecepatan pemutaran. Agar kompatibel dengan bentuk permintaan ucapan OpenAI, adapter menerima nilai speed dari 0.25 hingga 4.0 dan sengaja mengabaikannya. Model menentukan waktu ucapan sebenarnya; memilih kecepatan lain tidak meregangkan waktu WAV yang dihasilkan.
Lihat README contoh untuk permintaan curl langsung, perintah Docker, batas persis, dan perintah validasi luring.