Tích hợp LongCat AudioDiT
Libre WebUI đi kèm plugin JSON và adapter HTTP cục bộ cho các checkpoint chính thức meituan-longcat/LongCat-AudioDiT-1B và meituan-longcat/LongCat-AudioDiT-3.5B. Dự án upstream cung cấp API Python thay vì máy chủ HTTP, nên adapter trong examples/longcat-audiodit-server cung cấp chức năng khám phá mô hình, giọng nói JSON và các endpoint nhân bản giọng nói multipart.
AudioDiT trả về tệp WAV mono 24 kHz hoàn chỉnh thay vì phản hồi âm thanh streaming. Vì vậy Libre WebUI chia phản hồi dài tại ranh giới câu và cụm từ, tạo trước một số lô có giới hạn rồi lên lịch âm thanh đã giải mã theo thứ tự để phát liên tục.
Yêu cầu
GPU NVIDIA CUDA là mục tiêu thực tế. Hãy bắt đầu với checkpoint 1B; checkpoint 3.5B cần nhiều VRAM hơn đáng kể và mất nhiều thời gian nạp hơn. CPU có thể dùng để thử nghiệm nhưng khó đáp ứng tương tác.
Khởi động adapter
Clone bản triển khai chính thức và tạo môi trường cô lập:
git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
Sau đó khởi động một checkpoint:
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0
Theo mặc định, máy chủ lắng nghe tại 127.0.0.1:8300. Máy chủ chủ ý không dùng xác thực cho mục đích cục bộ, vì vậy không được đưa trực tiếp ra mạng không đáng tin cậy. Hãy dùng cổng HTTPS có xác thực khi Libre WebUI và adapter nằm trên các máy khác nhau: giọng nói tái sử dụng sẽ gửi bản ghi tham chiếu đã giải mã đến endpoint đó cho mỗi lô Giọng nói. Ví dụ Docker CUDA và kiểm tra sức khỏe được ghi trong examples/longcat-audiodit-server/README.md.
Bật plugin
Mở Cài đặt → Plugin → LongCat AudioDiT, kích hoạt và giữ các endpoint cục bộ mặc định trừ khi adapter chạy ở nơi khác. Khám phá mô hình chỉ công bố checkpoint đang nằm trong tiến trình máy chủ đó. Khởi động lại adapter để chuyển giữa mô hình 1B và 3.5B.
Khi cổng như llama-swap đứng trước adapter, hãy cấu hình Endpoint API Mô hình thành tuyến GET /v1/models của adapter qua cổng đó. Không trỏ khám phá mô hình vào POST /v1/audio/speech: khám phá thất bại sẽ quay về cả hai checkpoint trong manifest và có thể khiến UI chọn checkpoint mà adapter chưa nạp.
Dùng Cài đặt → Văn bản thành giọng nói để chọn LongCat cho việc phát nội dung trò chuyện. Phát tự nhiên theo lô được bật mặc định. Giới hạn chung 140 ký tự của nhà cung cấp giữ văn bản tiếng Trung dày đặc trong cửa sổ thời lượng ngắn hơn của checkpoint 1B; Libre WebUI tự động tạo nhiều lô cho phản hồi dài hơn.
Nhân bản giọng nói
Mở Sáng tạo → Âm thanh, chọn mô hình giọng nói LongCat rồi bật Nhân bản giọng nói tham chiếu. Tải lên bản ghi sạch và nhập chính xác các từ được nói. Đoạn ghi 3–10 giây, một người nói và ít tạp âm cho kết quả tốt nhất; adapter từ chối đoạn dài hơn 15 giây hoặc 10 MiB.
Bạn có thể chỉ nhân bản một lần hoặc chọn Lưu làm giọng có thể tái sử dụng, đặt tên riêng tư và xác nhận rõ người nói đồng ý lưu trữ. Giọng đã lưu có thể được chọn cho cùng mô hình LongCat trong Cài đặt → Văn bản thành giọng nói. Chức năng đọc to và tự động phát trong trò chuyện sau đó dùng lại giọng đó qua các lô nhận biết câu của Libre WebUI.
Bản tham chiếu chiếm một phần cửa sổ thời lượng của AudioDiT. Nếu giọng nói yêu cầu không vừa thời gian còn lại, adapter trả về lỗi máy khách rõ ràng thay vì âm thầm cắt âm thanh; hãy rút ngắn bản tham chiếu hoặc đoạn cần tạo rồi thử lại.
Chỉ nhân bản giọng khi có sự cho phép rõ ràng của người nói. Với lượt tạo một lần, Libre WebUI giữ bản tham chiếu trong bộ nhớ và adapter xóa tệp giải mã tạm sau yêu cầu. Khi bạn chủ động lưu giọng tái sử dụng, Libre WebUI lưu âm thanh tham chiếu gốc và bản chép lời chính xác trong hồ sơ theo phạm vi người dùng, được mã hóa AES-GCM. Libre WebUI không bao giờ thay bản tham chiếu chuẩn bằng bản bắt chước đã tạo. AudioDiT không cung cấp embedding người nói có thể di chuyển, nên cặp dữ liệu gốc được giải mã và gửi đến nhà cung cấp đã cấu hình cho mỗi lô được tạo. Bạn có thể xóa vĩnh viễn hồ sơ trong cài đặt Văn bản thành giọng nói. Hồ sơ đã lưu sẽ từ chối an toàn nếu tuyến hoặc endpoint đã duyệt của plugin thay đổi; hãy tạo lại sau khi xác minh đích mới.
Giọng nói được tạo được lưu riêng trong thư viện đa phương tiện mã hóa của người dùng. Xóa kết quả trong thư viện không xóa hồ sơ giọng đã lưu, và xóa hồ sơ giọng không xóa âm thanh đã tạo trước đó.
Nhà cung cấp hỗ trợ bản tham chiếu WAV, FLAC, MP3 và Ogg. Tiếng Anh và tiếng Trung Quan thoại là hai ngôn ngữ được ghi nhận có chất lượng tốt nhất. LongCat không phát hành giọng đặt tên sẵn, nên tổng hợp thông thường dùng giá trị mặc định của mô hình.
Điều khiển suy luận
Plugin cung cấp các biến nâng cao có giới hạn cho số bước ODE, cường độ hướng dẫn, phương thức hướng dẫn CFG/APG và seed. Libre WebUI chỉ chuyển tiếp những điều khiển được khai báo trong manifest đến cả endpoint giọng nói và nhân bản. Giá trị mặc định khớp với ví dụ suy luận upstream và là điểm khởi đầu tốt.
AudioDiT không cung cấp điều khiển tốc độ phát. Để tương thích với cấu trúc yêu cầu giọng nói OpenAI, adapter chấp nhận giá trị speed từ 0.25 đến 4.0 nhưng chủ ý bỏ qua. Mô hình quyết định nhịp giọng thực tế; chọn tốc độ khác không kéo giãn thời gian tệp WAV đã tạo.
Xem README của ví dụ để biết yêu cầu curl trực tiếp, lệnh Docker, giới hạn chính xác và lệnh xác thực ngoại tuyến.