Sprachmodus
Der Sprachmodus macht aus einem Chat eine freihändige, rundenbasierte Unterhaltung: Libre hört zu, transkribiert deine Worte, erzeugt eine Antwort und spricht sie aus, bevor es wieder zuhört. Du kannst eine gesprochene Antwort einfach unterbrechen, indem du darüber sprichst. Alles verwendet dieselben Verträge für Sprache-zu-Text und Text-zu-Sprache wie Diktat und Vorlesen im Editor. Der Sprachmodus ergänzt nur die Orchestrierung und führt keinen neuen Audiopfad ein.
Eine Unterhaltung beginnen
Öffne einen Chat und drücke neben dem Mikrofon im Editor auf die Schaltfläche für den Sprachmodus. Sie erscheint, sobald Spracheingabe verfügbar ist: entweder über ein Sprache-zu-Text-Modell eines Anbieters (derselbe Katalog wie beim Diktat, auf der Seite zu Sprache-zu-Text dokumentiert) oder über die Spracherkennung des Browsers. Gesprochene Antworten verwenden dein konfiguriertes Text-zu-Sprache-Modell und deine Stimme, einschließlich einer gespeicherten Stimme mit aktiver Einwilligung. Die öffnende Geste bereitet die Wiedergabe auf die Autoplay-Richtlinie des Browsers vor.
Die Unterhaltungsschleife
Es ist jeweils eine Runde aktiv, die vier sichtbare Phasen durchläuft:
| Phase | Vorgang |
|---|---|
| Zuhören | Das Mikrofon zeichnet auf; eine Pause von etwa 1.5 s beendet deine Runde |
| Transkribieren | Der ausgewählte Anbieter oder Browser transkribiert die Aufnahme |
| Denken | Das Transkript wird als normale Chatnachricht gesendet und beantwortet |
| Sprechen | Die Antwort wird mit deinen Text-zu-Sprache-Einstellungen abgespielt |
Steuerelemente bei geöffneter Überlagerung:
- Sprechen beendet beendet deine Runde sofort – nützlich in lauten Räumen oder wenn keine Audioanalyse zur automatischen Endpunkterkennung verfügbar ist.
- Stummschalten pausiert die Aufnahme, ohne die Unterhaltung zu verlassen; beim Aufheben beginnt eine neue Runde.
- Antwort überspringen beendet die Wiedergabe und kehrt zum Zuhören zurück.
- Unterbrechen: Sprich während der Wiedergabe. Sie stoppt, und die nächste Runde beginnt mit dem Zuhören.
- Schließen beendet die Sitzung: Mikrofonstream, laufende Transkription und Wiedergabe werden gestoppt.
Fehler beenden die Unterhaltung nie. Mikrofonfehler, abgelehnte Aufnahmen, Transkriptionsfehler oder Zeitüberschreitungen werden eingeblendet; anschließend kehrt der Sprachmodus zum Zuhören zurück.
Governance und Datenschutz
Der Sprachmodus besitzt einen eigenen Zugriffsmodus (voice-mode) in der
Sprachzugriffskarte der Benutzerverwaltung. Er ist von Sprache-zu-Text,
Text-zu-Sprache und Stimmenklonen getrennt; die Umgebungsvariable
VOICE_MODE_ACCESS_MODE legt ihn fest. Transkription und Sprachsynthese besitzen
ebenfalls eigene Funktionssperren. Wird eine eingeschränkt, ist der entsprechende
Teil deaktiviert. Aufnahmen folgen dem Sprache-zu-Text-Vertrag: validiert, begrenzt
und flüchtig. Das Audio einer Runde existiert nur bis zur Transkription; allein das
Transkript gelangt als normale Nachricht in den Chat.
Grenzen
- Der Sprachmodus ist rundenbasiert, nicht voll duplexfähig: Mikrofon und Modellstimme werden nicht gleichzeitig über eine Echtzeitverbindung gestreamt.
- Automatische Endpunkterkennung und Unterbrechen benötigen Audioanalyse. Kann der Browser sie nicht liefern, beendet Sprechen beendet die Runde manuell.
- Rundenbasierte Antworten laufen nacheinander. Während einer Unterbrechung gesprochene Wörter gelangen nicht in das nächste Transkript.