语音模式
语音模式把聊天变成免手持的轮次制对话:Libre 监听并转写你的话,生成回复后朗读, 然后继续监听。只需在回复播放时开口,就能打断它。所有处理都沿用编辑器听写和 朗读功能相同的语音转文字与文字转语音契约;语音模式只增加编排,不创建新的音频 路径。
开始对话
打开聊天,点击编辑器中麦克风旁的语音模式按钮。只要语音输入可用,按钮就会出现: 可以使用提供商的语音转文字模型(与编辑器听写使用同一目录,详见语音转文字页面), 也可以使用浏览器自带的语音识别。语音回复使用你配置的文字转语音模型和声音, 包括已保存且具有有效同意的声音;打开操作本身会满足浏览器的自动播放策略准备要求。
对话循环
每次只进行一个轮次,并依次经过四个可见阶段:
| 阶段 | 正在发生的事情 |
|---|---|
| 监听 | 麦克风录音;约 1.5 s 的停顿会结束你的轮次 |
| 转写 | 所选提供商或浏览器转写录音 |
| 思考 | 转写作为普通聊天消息发送,并生成回复 |
| 播放 | 按你的文字转语音设置播放回复 |
叠加面板打开时可使用:
- 说完了会立即结束本轮,适合嘈杂环境或无法分析音频以自动判断终点时使用。
- 静音会暂停采集但不退出对话;取消静音会开始新一轮。
- 跳过回复停止播放并返回监听。
- **插话:**在回复播放时开始说话,播放会停止并监听下一轮。
- 关闭会彻底结束会话:停止麦克风流、中止正在进行的转写并取消播放。
故障绝不会结束对话。麦克风错误、录音被拒、转写失败或回复超时会就地显示, 随后语音模式重新监听下一轮。
治理与隐私
语音模式在用户管理的语音访问卡中拥有独立访问模式(voice-mode),与语音转文字、
文字转语音和声音克隆分离;环境变量 VOICE_MODE_ACCESS_MODE 可固定该模式。转写和
语音合成也各有功能开关,因此限制其中任一项都会禁用循环的相应部分。录音遵循
语音转文字契约:经过验证、受限且为临时数据;每轮音频只存在到转写完成,只有
转写文本以普通消息进入聊天。
边界
- 语音模式是轮次制而非全双工:不会通过一个实时连接同时流式传输麦克风音频和 模型语音。
- 自动终点判断和插话需要音频分析;浏览器无法提供时,手动说完了会结束本轮。
- 每轮回复依次运行;插话时说出的内容不会带入下一轮转写。