Tryb głosowy
Tryb głosowy zmienia czat w naprzemienną rozmowę bez użycia rąk: Libre słucha, zapisuje Twoją wypowiedź, generuje odpowiedź i ją odczytuje, a następnie znów słucha. Aby przerwać odczytywanie, zacznij mówić. Wszystko korzysta z tych samych kontraktów zamiany mowy na tekst i tekstu na mowę co dyktowanie i czytanie na głos w kompozytorze; tryb głosowy dodaje tylko koordynację, nigdy nową ścieżkę dźwięku.
Rozpoczęcie rozmowy
Otwórz czat i naciśnij przycisk trybu głosowego obok mikrofonu. Pojawia się, gdy dostępne jest wejście mowy: model dostawcy zamieniający mowę na tekst (ten sam katalog co dyktowanie, opisany na odpowiedniej stronie) lub rozpoznawanie przeglądarki. Odpowiedzi używają skonfigurowanego modelu tekst-na-mowę i głosu — w tym zapisanego głosu z aktywną zgodą — a gest otwierający przygotowuje odtwarzanie zgodnie z polityką autoplay.
Pętla rozmowy
Jednocześnie aktywna jest jedna tura przechodząca przez cztery fazy:
| Faza | Co się dzieje |
|---|---|
| Słuchanie | Mikrofon nagrywa; pauza około 1.5 s kończy turę |
| Transkrypcja | Wybrany dostawca lub przeglądarka transkrybuje nagranie |
| Myślenie | Transkrypt jest wysyłany jako zwykła wiadomość i powstaje odpowiedź |
| Mówienie | Odpowiedź jest odtwarzana zgodnie z ustawieniami tekst-na-mowę |
Sterowanie przy otwartej nakładce:
- Koniec wypowiedzi natychmiast kończy turę — przydatne w hałasie lub bez analizy dźwięku do automatycznego wykrycia końca.
- Wycisz wstrzymuje nagrywanie bez opuszczania rozmowy; wyłączenie wyciszenia zaczyna nową turę.
- Pomiń odpowiedź zatrzymuje odtwarzanie i wraca do słuchania.
- Przerwanie głosem: zacznij mówić podczas odtwarzania; odpowiedź zatrzyma się i rozpocznie słuchanie kolejnej tury.
- Zamknij kończy sesję: strumień mikrofonu się zatrzymuje, trwająca transkrypcja jest przerywana, a odtwarzanie anulowane.
Błędy nigdy nie kończą rozmowy. Błąd mikrofonu, odrzucone nagranie, nieudana transkrypcja lub limit czasu odpowiedzi pojawiają się w interfejsie, po czym tryb wraca do słuchania.
Kontrola i prywatność
Tryb głosowy ma własny tryb dostępu (voice-mode) na karcie Dostęp głosowy w Zarządzaniu użytkownikami, oddzielny od mowy-na-tekst, tekstu-na-mowę i klonowania; VOICE_MODE_ACCESS_MODE go ustala. Transkrypcja i synteza mają też własne bramki, więc ograniczenie którejkolwiek wyłącza odpowiednią część pętli. Nagrania podlegają kontraktowi mowy-na-tekst: są sprawdzane, ograniczone i ulotne. Dźwięk istnieje tylko do transkrypcji, a do czatu trafia wyłącznie transkrypt.
Granice
- Tryb jest naprzemienny, nie full-duplex: nie przesyła równocześnie mikrofonu i mowy modelu jednym połączeniem czasu rzeczywistego.
- Automatyczne wykrywanie końca i przerwanie wymagają analizy dźwięku; bez niej ręczne Koniec wypowiedzi kończy turę.
- Odpowiedzi są wykonywane pojedynczo; słowa wypowiedziane podczas przerwania nie przechodzą do transkryptu następnej tury.