Röstläge
Röstläget gör en chatt till ett handsfree, turbaserat samtal: Libre lyssnar, transkriberar det du sade, genererar ett svar och läser upp det — och börjar sedan lyssna igen. Avbryt ett uppläst svar genom att börja prata över det. Allt går genom samma kontrakt för tal-till-text och text-till-tal som redigerarens diktering och uppläsningsfunktioner. Röstläget lägger bara till orkestrering, aldrig en ny ljudväg.
Starta ett samtal
Öppna en chatt och tryck på knappen för röstläge bredvid mikrofonen i redigeraren. Knappen visas när talinmatning är tillgänglig: antingen en tal-till-text-modell från en leverantör (samma katalog som för diktering i redigeraren, beskriven på sidan om tal-till-text) eller webbläsarens egen taligenkänning. Upplästa svar använder din konfigurerade text-till-tal-modell och röst — även en sparad röst med aktivt samtycke — och förbereds för webbläsarens policy för automatisk uppspelning genom den inledande gesten.
Samtalsloopen
En tur är aktiv åt gången och går genom fyra synliga faser:
| Fas | Vad som händer |
|---|---|
| Lyssnar | Mikrofonen spelar in; en paus på cirka 1,5 s avslutar din tur |
| Transkriberar | Inspelningen transkriberas av den valda leverantören eller webbläsaren |
| Tänker | Transkriptet skickas som ett vanligt chattmeddelande och svaret genereras |
| Talar | Svaret spelas upp med dina text-till-tal-inställningar |
Kontroller när överlägget är öppet:
- Done speaking avslutar din tur omedelbart — användbart i bullriga rum eller när ljudanalys för automatisk slutpunktsdetektering saknas.
- Mute pausar inspelningen utan att lämna samtalet. När ljudet slås på börjar en ny tur.
- Skip reply stoppar uppspelningen och återgår till lyssning.
- Barge-in: börja prata medan svaret spelas upp så stoppas uppspelningen och systemet börjar lyssna efter din nästa tur.
- Close stänger sessionen: mikrofonströmmen stoppas, pågående transkribering avbryts och uppspelningen avslutas.
Fel avslutar aldrig samtalet. Ett mikrofonfel, en avvisad inspelning, ett transkriberingsfel eller en timeout för svaret visas direkt, och röstläget återgår till att lyssna efter nästa tur.
Styrning och integritet
Röstläget styrs av sitt eget åtkomstläge (voice-mode) på kortet Voice access
i User Management, separat från tal-till-text, text-till-tal och röstkloning.
Miljövariabeln VOICE_MODE_ACCESS_MODE låser läget. Transkribering och
talsyntes körs också bakom sina egna funktionsspärrar, så en begränsning av
någon av dem inaktiverar den delen av loopen. Inspelningar följer kontraktet
för tal-till-text: de valideras, begränsas och är tillfälliga. Ljudet för en tur
finns bara så länge det behövs för transkribering, och endast transkriptet förs
in i chatten som ett vanligt meddelande.
Gränser
- Röstläget är turbaserat, inte full duplex: det strömmar inte mikrofonljud och modelltal samtidigt över en realtidsanslutning.
- Automatisk slutpunktsdetektering och avbrott genom att börja tala kräver ljudanalys. När webbläsaren inte kan tillhandahålla den avslutar den manuella kontrollen Done speaking turen.
- Turbaserade svar körs ett i taget. Ord som sägs under ett avbrott förs inte över till transkriptet för nästa tur.