Hop til hovedindhold

Stemmetilstand

Stemmetilstand gør en chat til en håndfri, turbaseret samtale: Libre lytter, transskriberer det, du sagde, genererer et svar og læser det højt — og begynder derefter at lytte igen. Afbryd et oplæst svar ved blot at begynde at tale hen over det. Alt går gennem de samme kontrakter for tale-til-tekst og tekst-til-tale som skrivefeltets diktering og oplæsning. Stemmetilstand tilføjer kun orkestrering, aldrig en ny lydvej.

Start en samtale

Åbn en chat, og tryk på knappen til stemmetilstand ved siden af mikrofonen i skrivefeltet. Knappen vises, når taleinput er tilgængeligt: enten en tale-til-tekst-model fra en udbyder (samme katalog som til diktering i skrivefeltet, dokumenteret på siden om tale-til-tekst) eller browserens egen talegenkendelse. Oplæste svar bruger din konfigurerede tekst-til-tale-model og stemme — også en gemt stemme med aktivt samtykke — og den første handling forbereder afspilningen i forhold til browserens autoplay-politik.

Samtaleløkken

Én tur er aktiv ad gangen og bevæger sig gennem fire synlige faser:

FaseHvad der sker
LytterMikrofonen optager; en pause på cirka 1,5 s afslutter din tur
TransskribererOptagelsen transskriberes af den valgte udbyder eller browseren
TænkerTransskriptionen sendes som en almindelig chatbesked, og svaret genereres
TalerSvaret afspilles via dine tekst-til-tale-indstillinger

Kontroller, mens overlayet er åbent:

  • Done speaking afslutter din tur med det samme — nyttigt i støjende rum, eller når lydanalyse til automatisk afslutning ikke er tilgængelig.
  • Mute sætter optagelsen på pause uden at forlade samtalen. Når lyden slås til igen, begynder en ny tur.
  • Skip reply stopper afspilningen og vender tilbage til lytning.
  • Barge-in: begynd at tale, mens svaret afspilles, så stopper afspilningen, og systemet lytter efter din næste tur.
  • Close lukker sessionen ned: mikrofonstreamen stopper, en igangværende transskription afbrydes, og afspilningen annulleres.

Fejl afslutter aldrig samtalen. En mikrofonfejl, en afvist optagelse, en transskriptionsfejl eller timeout på svaret vises direkte, og stemmetilstanden vender tilbage til at lytte efter næste tur.

Styring og privatliv

Stemmetilstand styres af sin egen adgangstilstand (voice-mode) på kortet Voice access i User Management, adskilt fra tale-til-tekst, tekst-til-tale og stemmekloning. Miljøvariablen VOICE_MODE_ACCESS_MODE låser indstillingen. Transskription og talesyntese kører også bag deres egne funktionsporte, så en begrænsning af en af dem deaktiverer den del af løkken. Optagelser følger kontrakten for tale-til-tekst: de valideres, afgrænses og er midlertidige. Lyden fra en tur findes kun længe nok til at blive transskriberet, og kun transskriptionen føres ind i chatten som en almindelig besked.

Grænser

  • Stemmetilstand er turbaseret, ikke fuld duplex: den streamer ikke mikrofonlyd og modeltale samtidig over én realtidsforbindelse.
  • Automatisk afslutning og afbrydelse ved tale kræver lydanalyse. Når browseren ikke kan levere den, afslutter den manuelle kontrol Done speaking turen.
  • Turbaserede svar kører ét ad gangen. Ord, der siges under en afbrydelse, føres ikke over i transskriptionen for næste tur.