Da voce a testo
Libre WebUI può trascrivere le registrazioni del microfono tramite un plugin attivo che dichiari la funzionalità di conversione della voce in testo. Quando il browser espone il proprio servizio di riconoscimento vocale, Chat seleziona tale servizio per impostazione predefinita; l'implementazione e il trattamento dei dati sono controllati dal fornitore del browser e non avvengono necessariamente sul dispositivo. Seleziona esplicitamente un provider denominato per usare il servizio STT del provider. Quando il servizio del browser non è disponibile, Chat seleziona il primo provider compatibile.
Il supporto incluso comprende:
- i modelli di trascrizione OpenAI tramite una richiesta multipart
/v1/audio/transcriptions; e - i modelli di riconoscimento vocale automatico Hugging Face tramite il relativo endpoint di inferenza per audio non elaborato.
Il browser registra solo dopo che l'utente ha premuto il pulsante del microfono. Prima della registrazione, Chat mostra il provider selezionato e l'avviso sul trasferimento. Premi nuovamente il pulsante per interrompere la registrazione; durante la trascrizione, lo stesso pulsante annulla la richiesta al provider. Libre inserisce la trascrizione restituita nel compositore. La registrazione viene mantenuta in memoria per la richiesta e non viene salvata da Libre WebUI. Passare a un'altra chat annulla l'autorizzazione del microfono in sospeso, la registrazione e la trascrizione.
Contratto del provider
Una funzionalità STT dichiara endpoint, mappa dei modelli, formati accettati, modalità della richiesta e variabile facoltativa dell'endpoint. Libre convalida l'esatto percorso plugin/modello dell'utente autenticato prima di inoltrare l'audio. Attualmente Libre accetta registrazioni WAV PCM non compresse e WebM Opus. Convalida estensione del file, tipo MIME dichiarato, struttura del container, identificatore del codec, frequenza di campionamento, canali, rapporto della dimensione decodificata e durata prima di inoltrare l'audio. Le richieste sono limitate a 25 MiB e 300 secondi a livello globale (o a un limite inferiore del manifest), con un massimo di due trascrizioni simultanee per utente e sei nell'intera distribuzione; vengono interrotte quando il browser si disconnette o si perde il permesso condiviso rinnovabile di ammissione. In modalità team, un errore dell'ammissione Redis blocca l'operazione; non crea mai un'autorizzazione indipendente per replica.
Le credenziali dei provider rimangono nel backend. Libre rifiuta i reindirizzamenti, affinché un'intestazione di autorizzazione o una registrazione audio non possa essere inoltrata a un host diverso. Gli errori di autenticazione del provider vengono mostrati come errori upstream, non come una sessione Libre scaduta.
Usa HTTPS per l'origine di Libre WebUI e per i provider remoti. I browser non espongono l'acquisizione dal microfono a un'origine remota non sicura e Libre non pubblicizza nessuno dei due percorsi vocali, a meno che il browser non esponga le proprie API multimediali per origini sicure. Il provider può conservare o elaborare le registrazioni secondo le proprie condizioni, quindi consulta tale criterio prima di dettare testo sensibile.