Lewati ke konten utama

Ucapan ke Teks

Libre WebUI mentranskripsikan rekaman melalui plugin STT aktif. Jika peramban menyediakan pengenalan ucapan, Chat memilihnya; implementasi dan data dikendalikan vendor peramban dan mungkin tidak lokal. Pilih penyedia bernama untuk STT penyedia. Jika layanan peramban tidak ada, Chat memilih penyedia pertama.

Dukungan bawaan:

  • Model OpenAI melalui /v1/audio/transcriptions; dan
  • Model Hugging Face melalui endpoint audio mentah.

Peramban merekam setelah tombol mikrofon ditekan. Chat menampilkan penyedia dan pemberitahuan transfer. Tekan lagi untuk berhenti; selama transkripsi tombol membatalkan permintaan. Libre memasukkan teks ke kolom pesan. Rekaman hanya di memori dan tidak disimpan. Berpindah chat membatalkan izin, rekaman, dan transkripsi.

Kontrak Penyedia

Kemampuan STT menyatakan endpoint, peta model, format, mode, dan variabel endpoint. Libre memvalidasi rute plugin/model pengguna. PCM WAV dan Opus WebM diterima. Ekstensi, MIME, kontainer, kodek, laju, kanal, rasio ukuran, dan durasi diperiksa. Batas 25 MiB, 300 detik, dua per pengguna, enam per penerapan. Permintaan batal saat peramban terputus atau izin bersama hilang. Kegagalan Redis pada team menolak akses; tidak ada jatah replika terpisah.

Kredensial tetap di backend. Pengalihan ditolak agar header dan audio tidak berpindah host. Kesalahan penyedia dilaporkan sebagai kegagalan hulu, bukan sesi Libre kedaluwarsa.

Gunakan HTTPS. Peramban tidak memberi mikrofon ke sumber tidak aman. Tinjau kebijakan penyedia sebelum mendikte teks sensitif.