Перейти к основному содержимому

Голосовой режим

Режим превращает чат в беседу по очереди: Libre слушает, расшифровывает, генерирует и произносит ответ, затем снова слушает. Заговорите поверх ответа, чтобы прервать. Используются те же контракты распознавания/синтеза, что диктовка и чтение; добавляется только оркестрация, не новый аудиопуть.

Начало разговора

Откройте чат и кнопку рядом с микрофоном. Она видна при модели speech-to-text (тот же каталог диктовки) или распознавании браузера. Ответ использует настроенную TTS-модель и голос, включая сохранённый с согласием; начальный жест готовит autoplay.

Петелька разговора

Одна тура в четырёх фазах:

ФазаПроисходит
СлушаниеМикрофон; пауза около 1.5 s завершает
РасшифровкаПровайдер или браузер транскрибирует
РазмышлениеТекст отправляется обычным сообщением и генерируется ответ
РечьОтвет звучит по TTS-настройкам

Управление:

  • Я закончил говорить завершает сразу — для шума или без анализа.
  • Без звука приостанавливает запись; снятие начинает новую туру.
  • Пропустить ответ останавливает и слушает.
  • Перебить: начните говорить, воспроизведение остановится.
  • Закрыть прекращает поток, транскрипцию и воспроизведение.

Ошибки не завершают беседу. Микрофон, отказ записи, транскрипция или тайм-аут показываются, затем снова слушание.

Управление и конфиденциальность

Отдельный режим доступа (voice-mode) на карточке Голос в управлении пользователями, отдельно от STT, TTS и клонирования; VOICE_MODE_ACCESS_MODE фиксирует. Синтез/распознавание имеют свои ограничения. Записи проверены, ограничены и эфемерны: живут до транскрипции, в чат входит только текст.

Границы

  • Поочерёдный, не full-duplex: микрофон и речь не идут одновременно одним realtime-соединением.
  • Автоконец и перебивание требуют анализа; без него Я закончил говорить.
  • Ответы по одному; слова перебивания не переходят в следующую транскрипцию.