Aller au contenu principal

Mode vocal

Le mode vocal transforme un chat en conversation mains libres au tour par tour : Libre écoute, transcrit vos paroles, génère une réponse et vous la lit, puis se remet à écouter. Pour interrompre une réponse parlée, il suffit de parler par-dessus. Tout passe par les mêmes contrats de transcription de la parole et de synthèse vocale que les fonctions de dictée et de lecture à voix haute du compositeur ; le mode vocal ajoute uniquement l’orchestration, jamais un nouveau circuit audio.

Démarrer une conversation

Ouvrez un chat et appuyez sur le bouton du mode vocal à côté du microphone dans le compositeur. Le bouton apparaît dès que la saisie vocale est disponible : soit par un modèle de transcription de la parole d’un fournisseur (le même catalogue que la dictée du compositeur, documenté sur la page consacrée à la transcription), soit par la reconnaissance vocale du navigateur. Les réponses parlées utilisent votre modèle et votre voix de synthèse vocale configurés — y compris une voix enregistrée avec consentement actif — et le geste d’ouverture les prépare au respect de la politique de lecture automatique du navigateur.

La boucle de conversation

Un seul tour est actif à la fois et traverse quatre phases visibles :

PhaseDéroulement
ÉcouteLe microphone enregistre ; une pause d’environ 1.5 s termine votre tour
TranscriptionL’enregistrement est transcrit par le fournisseur choisi ou le navigateur
RéflexionLa transcription est envoyée comme un message de chat normal et la réponse est générée
LectureLa réponse est lue selon vos réglages de synthèse vocale

Commandes disponibles tant que la fenêtre superposée est ouverte :

  • Fin de la prise de parole termine immédiatement votre tour, ce qui est utile dans les environnements bruyants ou lorsque l’analyse audio ne permet pas la détection automatique de la fin.
  • Muet suspend la capture sans quitter la conversation ; désactiver le mode muet commence un nouveau tour.
  • Ignorer la réponse arrête la lecture et relance l’écoute.
  • Interruption vocale : commencez à parler pendant la lecture de la réponse ; celle-ci s’arrête et l’écoute reprend pour votre prochain tour.
  • Fermer met fin à la session : le flux du microphone s’arrête, toute transcription en cours est abandonnée et la lecture est annulée.

Les échecs ne mettent jamais fin à la conversation. Une erreur de microphone, un enregistrement rejeté, un échec de transcription ou l’expiration du délai d’une réponse s’affiche directement, puis le mode vocal reprend l’écoute du tour suivant.

Gouvernance et confidentialité

Le mode vocal possède son propre mode d’accès (voice-mode) dans la fiche d’accès vocal de la gestion des utilisateurs. Il est distinct de la transcription de la parole, de la synthèse vocale et du clonage de voix ; la variable d’environnement VOICE_MODE_ACCESS_MODE le fixe. La transcription et la synthèse vocale sont elles aussi soumises à leurs propres contrôles de fonctionnalité : restreindre l’une ou l’autre désactive la partie correspondante de la boucle. Les enregistrements respectent le contrat de transcription : ils sont validés, limités et éphémères. L’audio d’un tour n’existe que le temps nécessaire à sa transcription et seule la transcription rejoint le chat sous forme de message normal.

Frontières

  • Le mode vocal fonctionne au tour par tour, et non en duplex intégral : il ne diffuse pas simultanément l’audio du microphone et la parole du modèle sur une même connexion en temps réel.
  • La détection automatique de fin et l’interruption vocale nécessitent une analyse audio. Si le navigateur ne peut pas la fournir, la commande manuelle Fin de la prise de parole termine le tour.
  • Les réponses au tour par tour s’exécutent une à une ; les mots prononcés pendant une interruption vocale ne sont pas repris dans la transcription du tour suivant.