Ενσωμάτωση LongCat AudioDiT
Το Libre WebUI περιλαμβάνει ένα πρόσθετο JSON και έναν τοπικό προσαρμογέα HTTP για τα επίσημα checkpoints meituan-longcat/LongCat-AudioDiT-1B και meituan-longcat/LongCat-AudioDiT-3.5B. Το upstream έργο παρέχει API Python αντί για διακομιστή HTTP, επομένως ο προσαρμογέας στο examples/longcat-audiodit-server προσφέρει εντοπισμό μοντέλων, ομιλία JSON και multipart endpoints κλωνοποίησης φωνής.
Το AudioDiT επιστρέφει πλήρη μονοφωνικά αρχεία WAV 24 kHz αντί για ροή ήχου. Γι' αυτό το Libre WebUI χωρίζει τις μεγαλύτερες απαντήσεις στα όρια προτάσεων και φράσεων, δημιουργεί εκ των προτέρων περιορισμένο αριθμό παρτίδων και προγραμματίζει τον αποκωδικοποιημένο ήχο με τη σωστή σειρά για συνεχή αναπαραγωγή.
Απαιτήσεις
Μια GPU NVIDIA CUDA είναι η πρακτική επιλογή. Ξεκινήστε με το checkpoint 1B· το checkpoint 3.5B χρειάζεται αισθητά περισσότερη VRAM και φορτώνεται πιο αργά. Η CPU είναι διαθέσιμη για πειραματισμό, αλλά δύσκολα προσφέρει διαδραστική απόδοση.
Εκκίνηση του προσαρμογέα
Κλωνοποιήστε την επίσημη υλοποίηση και δημιουργήστε απομονωμένο περιβάλλον:
git clone https://github.com/meituan-longcat/LongCat-AudioDiT.git
python3 -m venv .venv
source .venv/bin/activate
pip install -r examples/longcat-audiodit-server/requirements.txt
export PYTHONPATH="$PWD/LongCat-AudioDiT"
Στη συνέχεια εκκινήστε ένα checkpoint:
python examples/longcat-audiodit-server/server.py \
--model meituan-longcat/LongCat-AudioDiT-1B \
--device cuda:0
Ο διακομιστής συνδέεται από προεπιλογή στο 127.0.0.1:8300. Σκόπιμα δεν απαιτεί έλεγχο ταυτότητας για τοπική χρήση, γι' αυτό μην τον εκθέτετε απευθείας σε μη έμπιστο δίκτυο. Χρησιμοποιήστε πύλη HTTPS με έλεγχο ταυτότητας όταν το Libre WebUI και ο προσαρμογέας βρίσκονται σε διαφορετικούς host: οι επαναχρησιμοποιήσιμες φωνές στέλνουν την αποκρυπτογραφημένη ηχογράφηση αναφοράς σε αυτό το endpoint για κάθε παρτίδα Ομιλίας. Ένα παράδειγμα Docker με CUDA και ο έλεγχος εύρυθμης λειτουργίας τεκμηριώνονται στο examples/longcat-audiodit-server/README.md.
Ενεργοποίηση του προσθέτου
Ανοίξτε Ρυθμίσεις → Πρόσθετα → LongCat AudioDiT, ενεργοποιήστε το και διατηρήστε τα προεπιλεγμένα τοπικά endpoints, εκτός αν ο προσαρμογέας εκτελείται αλλού. Ο εντοπισμός μοντέλων προβάλλει μόνο το checkpoint που βρίσκεται στη διεργασία αυτού του διακομιστή. Επανεκκινήστε τον προσαρμογέα για εναλλαγή μεταξύ των μοντέλων 1B και 3.5B.
Όταν μια πύλη όπως το llama-swap βρίσκεται μπροστά από τον προσαρμογέα, ρυθμίστε το Endpoint API μοντέλων στη διαδρομή GET /v1/models του προσαρμογέα μέσω αυτής της πύλης. Μην κατευθύνετε τον εντοπισμό μοντέλων στο POST /v1/audio/speech: αν ο εντοπισμός αποτύχει, χρησιμοποιούνται ως εφεδρεία και τα δύο checkpoints του manifest, επιτρέποντας ενδεχομένως στο UI να επιλέξει checkpoint που δεν έχει φορτωθεί από τον προσαρμογέα.
Χρησιμοποιήστε Ρυθμίσεις → Μετατροπή κειμένου σε ομιλία για να επιλέξετε το LongCat στην αναπαραγωγή συνομιλίας. Η φυσική αναπαραγωγή σε παρτίδες είναι ενεργή από προεπιλογή. Το κοινό όριο 140 χαρακτήρων του παρόχου διατηρεί το πυκνό κινεζικό κείμενο μέσα στο μικρότερο χρονικό παράθυρο του checkpoint 1B· το Libre WebUI δημιουργεί αυτόματα πολλές παρτίδες για μεγαλύτερες απαντήσεις.
Κλωνοποίηση φωνής
Ανοίξτε Δημιουργία → Ήχος, επιλέξτε μοντέλο ομιλίας LongCat και ενεργοποιήστε Κλωνοποίηση φωνής αναφοράς. Μεταφορτώστε καθαρή ηχογράφηση και εισαγάγετε τις ακριβείς λέξεις που ακούγονται. Ένα απόσπασμα 3–10 δευτερολέπτων με έναν ομιλητή και λίγο θόρυβο περιβάλλοντος λειτουργεί καλύτερα· ο προσαρμογέας απορρίπτει αποσπάσματα άνω των 15 δευτερολέπτων ή 10 MiB.
Η κλωνοποίηση μπορεί να παραμείνει εφάπαξ δημιουργία ή μπορείτε να επιλέξετε Αποθήκευση ως επαναχρησιμοποιήσιμη φωνή, να δώσετε στη φωνή ιδιωτικό όνομα και να επιβεβαιώσετε ρητά ότι ο ομιλητής συναινεί στην αποθήκευση. Οι αποθηκευμένες φωνές γίνονται διαθέσιμες για το ίδιο μοντέλο LongCat στις Ρυθμίσεις → Μετατροπή κειμένου σε ομιλία. Στη συνέχεια, η ανάγνωση συνομιλίας και η αυτόματη αναπαραγωγή επαναχρησιμοποιούν αυτή τη φωνή στις παρτίδες του Libre WebUI που λαμβάνουν υπόψη τα όρια προτάσεων.
Η αναφορά καταναλώνει μέρος του χρονικού παραθύρου του AudioDiT. Αν η ζητούμενη ομιλία δεν χωρά στον υπόλοιπο χρόνο, ο προσαρμογέας επιστρέφει σαφές σφάλμα πελάτη αντί να περικόψει σιωπηρά τον ήχο· συντομεύστε την αναφορά ή το παραγόμενο απόσπασμα και δοκιμάστε ξανά.
Κλωνοποιείτε μια φωνή μόνο με τη ρητή άδεια του ομιλητή. Για εφάπαξ δημιουργία, το Libre WebUI διατηρεί την αναφορά στη μνήμη και ο προσαρμογέας αφαιρεί το προσωρινό αρχείο αποκωδικοποίησης μετά το αίτημα. Όταν αποθηκεύετε ρητά μια επαναχρησιμοποιήσιμη φωνή, το Libre WebUI αποθηκεύει τον αρχικό ήχο αναφοράς και την ακριβή μεταγραφή σε προφίλ περιορισμένο στον χρήστη και κρυπτογραφημένο με AES-GCM. Δεν αντικαθιστά ποτέ την κανονική αναφορά με την παραγόμενη απομίμηση. Το AudioDiT δεν διαθέτει φορητό embedding ομιλητή, επομένως το αρχικό ζεύγος αποκρυπτογραφείται και αποστέλλεται στον ρυθμισμένο πάροχο για κάθε παραγόμενη παρτίδα. Μπορείτε να διαγράψετε οριστικά το προφίλ από τις ρυθμίσεις Μετατροπής κειμένου σε ομιλία. Ένα αποθηκευμένο προφίλ αποτυγχάνει με ασφαλή τρόπο αν αλλάξει η εγκεκριμένη δρομολόγηση ή το endpoint του προσθέτου· δημιουργήστε το ξανά αφού επαληθεύσετε τον νέο προορισμό.
Η παραγόμενη ομιλία αποθηκεύεται ξεχωριστά στην κρυπτογραφημένη συλλογή πολυμέσων του χρήστη. Η διαγραφή ενός αποτελέσματος της συλλογής δεν διαγράφει το αποθηκευμένο προφίλ φωνής του και η διαγραφή ενός προφίλ φωνής δεν αφαιρεί ήχο που δημιουργήθηκε προηγουμένως στη συλλογή.
Ο πάροχος υποστηρίζει αναφορές WAV, FLAC, MP3 και Ogg. Τα αγγλικά και τα μανδαρινικά κινεζικά είναι οι καλύτερα τεκμηριωμένοι γλωσσικοί στόχοι. Το LongCat δεν δημοσιεύει προκαθορισμένες ονομασμένες φωνές, επομένως η κανονική σύνθεση χρησιμοποιεί την προεπιλογή του μοντέλου.
Στοιχεία ελέγχου συμπερασμού
Το πρόσθετο διαθέτει οριοθετημένες προηγμένες μεταβλητές για βήματα ODE, ισχύ καθοδήγησης, μέθοδο καθοδήγησης CFG/APG και seed. Το Libre WebUI προωθεί μόνο τα στοιχεία ελέγχου που δηλώνονται στο manifest τόσο στα endpoints ομιλίας όσο και στα endpoints κλωνοποίησης. Οι προεπιλογές αντιστοιχούν στο upstream παράδειγμα συμπερασμού και αποτελούν καλό σημείο εκκίνησης.
Το AudioDiT δεν διαθέτει έλεγχο ταχύτητας αναπαραγωγής. Για συμβατότητα με τη μορφή αιτήματος ομιλίας OpenAI, ο προσαρμογέας δέχεται τιμές speed από 0.25 έως 4.0 και τις αγνοεί σκόπιμα. Το μοντέλο καθορίζει τον πραγματικό χρονισμό της ομιλίας· η επιλογή άλλης ταχύτητας δεν μεταβάλλει χρονικά το παραγόμενο WAV.
Ανατρέξτε στο README του παραδείγματος για άμεσα αιτήματα curl, εντολές Docker, ακριβή όρια και εντολές επικύρωσης εκτός σύνδεσης.