मुख्य कंटेंट तक स्किप करें

LongCat AudioDiT एकीकरण

Libre WebUI में आधिकारिक meituan-longcat/LongCat-AudioDiT-1B और meituan-longcat/LongCat-AudioDiT-3.5B checkpoints के लिए JSON प्लगइन और स्थानीय HTTP adapter है। मूल परियोजना HTTP सर्वर के बजाय Python API देती है, इसलिए examples/longcat-audiodit-server मॉडल खोज, JSON भाषण और multipart आवाज़ क्लोन एंडपॉइंट देता है।

AudioDiT स्ट्रीम के बजाय पूर्ण 24 kHz mono WAV लौटाता है। Libre लंबे उत्तर को वाक्य/वाक्यांश सीमा पर बाँटता, सीमित batch पहले बनाता और निरंतर प्लेबैक के लिए क्रम में रखता है।

आवश्यकताएँ

NVIDIA CUDA GPU व्यावहारिक लक्ष्य है। 1B से शुरू करें; 3.5B को अधिक VRAM और लोड समय चाहिए। CPU प्रयोग के लिए है, इंटरैक्टिव होने की संभावना कम है।

Adapter शुरू करें

git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0

सर्वर डिफ़ॉल्ट 127.0.0.1:8300 पर और स्थानीय उपयोग के लिए बिना प्रमाणीकरण चलता है; अविश्वसनीय नेटवर्क पर न खोलें। अलग होस्ट पर प्रमाणित HTTPS gateway उपयोग करें: पुनः उपयोग योग्य आवाज़ हर Speech batch में decrypted संदर्भ वहाँ भेजती है। CUDA Docker उदाहरण और स्वास्थ्य जाँच examples/longcat-audiodit-server/README.md में हैं।

प्लगइन चालू करें

सेटिंग → प्लगइन → LongCat AudioDiT में चालू करें और adapter स्थानीय हो तो डिफ़ॉल्ट एंडपॉइंट छोड़ें। खोज केवल प्रक्रिया में लोड checkpoint बताती है। 1B/3.5B बदलने के लिए adapter पुनः शुरू करें।

llama-swap gateway में मॉडल API एंडपॉइंट को gateway के माध्यम से GET /v1/models बनाएँ। खोज को POST /v1/audio/speech पर न भेजें; विफल खोज दोनों मैनिफ़ेस्ट मॉडल दिखाकर न लोड मॉडल चुनवा सकती है।

सेटिंग → पाठ-to-Speech में LongCat चुनें। प्राकृतिक batch प्लेबैक डिफ़ॉल्ट है। साझा 140-अक्षर सीमा घना चीनी पाठ 1B की छोटी अवधि में रखती है; लंबे उत्तर स्वतः batch बनते हैं।

आवाज़ क्लोनिंग

Imagine → ऑडियो में LongCat मॉडल चुनकर Clone a संदर्भ आवाज़ खोलें। साफ़ रिकॉर्डिंग और बोले गए ठीक शब्द दें। 3–10 सेकंड, एक वक्ता, कम शोर सर्वोत्तम; 15 सेकंड या 10 MiB से अधिक अस्वीकृत।

एकबारगी रखें या निजी नाम से reusable आवाज़ सहेजकर वक्ता की संग्रह सहमति स्पष्ट करें। वही मॉडल इसे सेटिंग में दिखाता और चैट पढ़ाई batch में उपयोग करती है।

संदर्भ AudioDiT अवधि का भाग लेता है। अनुरोधित भाषण न समाए तो स्पष्ट client त्रुटि आता है, चुपचाप नहीं कटता; संदर्भ या पाठ छोटा करें।

केवल स्पष्ट अनुमति से क्लोन करें। एकबारगी में Libre संदर्भ मेमोरी में रखता और adapter अस्थायी फ़ाइल हटाता है। सहेजने पर मूल ऑडियो और transcript उपयोगकर्ता-scoped AES-GCM प्रोफ़ाइल में एन्क्रिप्ट होते हैं; generated imitation canonical संदर्भ नहीं बनती। AudioDiT portable speaker embedding नहीं देता, इसलिए मूल जोड़ी हर batch में decrypt होकर प्रदाता को जाती है। प्रोफ़ाइल स्थायी हट सकती है। स्वीकृत रूट/एंडपॉइंट बदले तो सुरक्षित असफल होगा; नया लक्ष्य जाँचकर पुनः बनाएँ।

उत्पन्न भाषण एन्क्रिप्टेड मीडिया गैलरी में अलग है। गैलरी परिणाम हटाना प्रोफ़ाइल और प्रोफ़ाइल हटाना पुराना ऑडियो नहीं हटाता।

WAV, FLAC, MP3, Ogg समर्थित हैं। सबसे मजबूत भाषाएँ अंग्रेज़ी और Mandarin Chinese हैं। कोई preset named आवाज़ नहीं; सामान्य synthesis मॉडल डिफ़ॉल्ट उपयोग करती है।

इंफ़रेंस नियंत्रण

प्लगइन ODE चरण, guidance strength, CFG/APG विधि और seed के सीमित advanced variables देता है। Libre केवल मैनिफ़ेस्ट-declared नियंत्रण दोनों एंडपॉइंट को भेजता है। डिफ़ॉल्ट upstream उदाहरण से मेल खाते हैं।

AudioDiT playback speed नियंत्रण नहीं देता। OpenAI आकार के लिए adapter speed 0.25 से 4.0 स्वीकारकर जानबूझकर अनदेखा करता है। वास्तविक समय मॉडल तय करता है; WAV समय-stretch नहीं होता।

सीधे curl, Docker, सटीक सीमाएँ और ऑफ़लाइन जाँच के लिए उदाहरण README देखें।