Aller au contenu principal

Reconnaissance vocale

Libre WebUI peut transcrire les enregistrements du microphone au moyen d'une extension active qui déclare une fonctionnalité de reconnaissance vocale. Lorsque le navigateur expose son service de reconnaissance vocale, le chat sélectionne ce service par défaut ; sa mise en œuvre et le traitement des données sont contrôlés par le fournisseur du navigateur et ne s'effectuent pas nécessairement sur l'appareil. Sélectionnez explicitement un fournisseur nommé pour utiliser la reconnaissance vocale adossée à celui-ci. Lorsque le service du navigateur est indisponible, le chat sélectionne le premier fournisseur compatible.

La prise en charge intégrée comprend :

  • Les modèles de transcription OpenAI au moyen d'une requête multipartie /v1/audio/transcriptions ; et
  • Les modèles de reconnaissance vocale automatique de Hugging Face au moyen de son point de terminaison d'inférence audio brute.

Le navigateur n'enregistre qu'après que l'utilisateur a appuyé sur le bouton du microphone. Le chat affiche le fournisseur sélectionné et l'avis de transfert avant l'enregistrement. Appuyez à nouveau sur le bouton pour arrêter l'enregistrement ; pendant la transcription, ce même bouton annule la requête au fournisseur. Libre insère la transcription renvoyée dans la zone de rédaction. L'enregistrement est conservé en mémoire pour la requête et n'est pas enregistré par Libre WebUI. Naviguer vers un autre chat annule toute demande d'autorisation du microphone, tout enregistrement et toute transcription en attente.

Contrat du fournisseur

Une fonctionnalité STT déclare un point de terminaison, une table de modèles, les formats acceptés, le mode de requête et une variable de point de terminaison facultative. Libre valide la route exacte de l'extension et du modèle de l'utilisateur authentifié avant de transmettre l'audio. Libre accepte actuellement les enregistrements PCM WAV non compressés et Opus WebM. Il valide l'extension du nom de fichier, le type MIME déclaré, la structure du conteneur, l'identifiant du codec, la fréquence d'échantillonnage, les canaux, le rapport de taille après décodage et la durée avant de transmettre l'audio. Les requêtes sont limitées à 25 MiB et 300 secondes globalement (ou à une limite inférieure du manifeste), avec au maximum deux transcriptions simultanées par utilisateur et six sur l'ensemble du déploiement ; elles sont interrompues lorsque le navigateur se déconnecte ou que l'autorisation d'admission partagée renouvelable est perdue. En mode équipe, une défaillance de l'admission Redis échoue de manière fermée et ne crée jamais de quota indépendant par réplique.

Les identifiants du fournisseur restent sur le serveur. Libre refuse les redirections afin qu'un en-tête d'autorisation ou un enregistrement audio ne puisse pas être transmis à un autre hôte. Les échecs d'authentification du fournisseur sont présentés comme une défaillance en amont, et non comme une session Libre expirée.

Utilisez HTTPS pour l'origine de Libre WebUI et les fournisseurs distants. Les navigateurs n'autorisent pas la capture du microphone depuis une origine distante non sécurisée, et Libre n'annonce aucun des deux parcours vocaux sauf si le navigateur expose ses API multimédias pour origine sécurisée. Le fournisseur peut conserver ou traiter les enregistrements selon ses propres conditions ; examinez donc sa politique avant de dicter du texte sensible.