Pipeline (Standard)
Klassische dreistufige Architektur: Speech-to-Text → LLM → Text-to-Speech. Wähle jede Stufe aus den Modellen, die deinem Workspace zur Verfügung stehen.- Volle Kontrolle: Wähle STT, LLM und TTS unabhängig voneinander, inklusive Fallback-Ketten pro Stufe.
- Größte Modell- und Stimmenauswahl, beste mehrsprachige Abdeckung.
- Turn-Erkennung über ein semantisches Turn-Modell oder Sprachaktivitätserkennung (konfigurierbar).
Realtime
Ein einzelnes Speech-to-Speech-Modell hört zu und spricht direkt – ohne separates STT oder TTS.- Geringste Latenz und sehr natürliche Prosodie (Lachen, Zögern, Tonfall).
- Die Stimmenauswahl kommt aus dem Realtime-Modell.
- Die Turn-Erkennung kann robust, semantisch oder adaptiv arbeiten, wenn der gewählte Sprachmodus dies unterstützt. Andere Sprachmodi steuern das Timing automatisch.
- Weniger Stellschrauben: Stimmenbibliothek und Fallbacks pro Stufe entfallen.
Half-Cascade
Ein Hybrid: Ein Realtime-Modell übernimmt das Zuhören und Denken (rein textbasiert), während eine separate TTS-Stimme spricht. Half-Cascade hat eine eigene, textfähige Realtime-Modellauswahl, unabhängig von der vollständigen Realtime-Auswahl. Eine Änderung daran wirkt sich nie auf die separate TTS-Stimme aus.- Verständnis und Turn-Taking auf Realtime-Niveau, kombiniert mit der von dir gewählten TTS-Stimme – auch geklonte oder Markenstimmen sind möglich.
- Die Ausgabestimme konfigurierst du genau wie im Pipeline-Modus.
Turn-Erkennung bei Realtime
Bei kompatiblen Realtime- und Half-Cascade-Assistenten legst du fest, wie der Assistent erkennt, dass der Anrufer zu Ende gesprochen hat:- Robust (VAD) – reagiert nach einer klaren Pause. Schnell und vorhersehbar.
- Semantic – wartet, bis der Anrufer seinen Gedanken offenbar zu Ende gebracht hat, auch bei einer Pause mitten im Satz. Response eagerness steuert, wie früh geantwortet wird.
- Adaptive – kurze Bestätigungen wie „mhm“ oder „okay“ stoppen den Assistenten nicht, während eine klare Unterbrechung den Anrufer übernehmen lässt. Zusätzlich lassen sich Mindeststille, Sprachempfindlichkeit und Unterbrechungsdauer einstellen oder Unterbrechungen ganz deaktivieren.
Zuverlässigkeitsverhalten
Ist die gewählte Realtime- oder Half-Cascade-Konfiguration vorübergehend nicht verfügbar, nutzt der Assistent nach Möglichkeit eine kompatible Ausweichoption, damit der laufende Anruf fortgesetzt werden kann.
Kurzvergleich
Fehlerbehebung
Kontextverlust mitten im Anruf
Der Assistent fragt nach Informationen, die er schon bekommen hat, oder scheint etwas Vorheriges vergessen zu haben. Das ist ein Verständnisproblem, kein Regler am Engine-Modus. Halte die benötigten Fakten in der Wissensdatenbank statt nur im Prompt, und nutze in einem Flowcollect-Knoten, damit erfasste Antworten zu Anrufvariablen werden, auf die der restliche Flow zugreifen kann, statt erneut zu fragen. Wenn dein Plan dir erlaubt, das Sprachmodell selbst zu wählen, hält ein leistungsfähigeres Modell auch ein langes Gespräch zuverlässiger zusammen.