Przejdź do głównej zawartości

Tryb głosowy

Tryb głosowy zmienia czat w naprzemienną rozmowę bez użycia rąk: Libre słucha, zapisuje Twoją wypowiedź, generuje odpowiedź i ją odczytuje, a następnie znów słucha. Aby przerwać odczytywanie, zacznij mówić. Wszystko korzysta z tych samych kontraktów zamiany mowy na tekst i tekstu na mowę co dyktowanie i czytanie na głos w kompozytorze; tryb głosowy dodaje tylko koordynację, nigdy nową ścieżkę dźwięku.

Rozpoczęcie rozmowy

Otwórz czat i naciśnij przycisk trybu głosowego obok mikrofonu. Pojawia się, gdy dostępne jest wejście mowy: model dostawcy zamieniający mowę na tekst (ten sam katalog co dyktowanie, opisany na odpowiedniej stronie) lub rozpoznawanie przeglądarki. Odpowiedzi używają skonfigurowanego modelu tekst-na-mowę i głosu — w tym zapisanego głosu z aktywną zgodą — a gest otwierający przygotowuje odtwarzanie zgodnie z polityką autoplay.

Pętla rozmowy

Jednocześnie aktywna jest jedna tura przechodząca przez cztery fazy:

FazaCo się dzieje
SłuchanieMikrofon nagrywa; pauza około 1.5 s kończy turę
TranskrypcjaWybrany dostawca lub przeglądarka transkrybuje nagranie
MyślenieTranskrypt jest wysyłany jako zwykła wiadomość i powstaje odpowiedź
MówienieOdpowiedź jest odtwarzana zgodnie z ustawieniami tekst-na-mowę

Sterowanie przy otwartej nakładce:

  • Koniec wypowiedzi natychmiast kończy turę — przydatne w hałasie lub bez analizy dźwięku do automatycznego wykrycia końca.
  • Wycisz wstrzymuje nagrywanie bez opuszczania rozmowy; wyłączenie wyciszenia zaczyna nową turę.
  • Pomiń odpowiedź zatrzymuje odtwarzanie i wraca do słuchania.
  • Przerwanie głosem: zacznij mówić podczas odtwarzania; odpowiedź zatrzyma się i rozpocznie słuchanie kolejnej tury.
  • Zamknij kończy sesję: strumień mikrofonu się zatrzymuje, trwająca transkrypcja jest przerywana, a odtwarzanie anulowane.

Błędy nigdy nie kończą rozmowy. Błąd mikrofonu, odrzucone nagranie, nieudana transkrypcja lub limit czasu odpowiedzi pojawiają się w interfejsie, po czym tryb wraca do słuchania.

Kontrola i prywatność

Tryb głosowy ma własny tryb dostępu (voice-mode) na karcie Dostęp głosowy w Zarządzaniu użytkownikami, oddzielny od mowy-na-tekst, tekstu-na-mowę i klonowania; VOICE_MODE_ACCESS_MODE go ustala. Transkrypcja i synteza mają też własne bramki, więc ograniczenie którejkolwiek wyłącza odpowiednią część pętli. Nagrania podlegają kontraktowi mowy-na-tekst: są sprawdzane, ograniczone i ulotne. Dźwięk istnieje tylko do transkrypcji, a do czatu trafia wyłącznie transkrypt.

Granice

  • Tryb jest naprzemienny, nie full-duplex: nie przesyła równocześnie mikrofonu i mowy modelu jednym połączeniem czasu rzeczywistego.
  • Automatyczne wykrywanie końca i przerwanie wymagają analizy dźwięku; bez niej ręczne Koniec wypowiedzi kończy turę.
  • Odpowiedzi są wykonywane pojedynczo; słowa wypowiedziane podczas przerwania nie przechodzą do transkryptu następnej tury.