跳到主要内容

语音转文字

Libre WebUI 可通过声明 STT 能力的活动插件转录麦克风。浏览器提供语音识别服务时,Chat 默认选择该服务;实现和数据处理由浏览器厂商控制,不一定在设备上完成。要使用提供商 STT,请明确选择提供商;浏览器服务不可用时选择第一个兼容提供商。

内置支持包括通过 Multipart 请求 /v1/audio/transcriptions 使用 OpenAI 转录模型,以及通过原始音频推理端点使用 Hugging Face ASR。

只有用户按下麦克风后浏览器才录音。Chat 会提前显示提供商和传输说明;再次按下会停止,转录期间则取消请求。Libre 将结果插入编辑器。录音只在请求内存中保存,切换聊天会取消待处理权限、录音和转录。

提供商契约

STT 能力声明端点、模型映射、格式、请求模式和可选变量。Libre 在转发前验证已认证用户的确切路由。当前接受未压缩 PCM WAV 和 Opus WebM,并验证扩展名、MIME、容器、Codec、采样率、声道、解码大小比和时长。全局上限为 25 MiB 和 300 秒(或 Manifest 的更低限制),每用户并发两项、全部署六项;浏览器断开或失去可续期准入许可时中止。team 模式 Redis 准入失败会关闭式失败,不会创建副本级额度。

提供商凭据留在后端。Libre 拒绝重定向,避免 Authorization 或录音被转发到其他主机。提供商认证错误显示为上游故障,而非 Libre 会话过期。

Libre WebUI Origin 和远程提供商应使用 HTTPS。浏览器不会向不安全远程 Origin 开放麦克风;Libre 也只在安全媒体 API 可用时公布语音路径。敏感听写前请检查提供商的数据政策。