> ## Documentation Index
> Fetch the complete documentation index at: https://docs.famulor.io/llms.txt
> Use this file to discover all available pages before exploring further.

# Engine-Modi

> Pipeline, Realtime und Half-Cascade – wie dein Assistent hört und spricht

Die Einstellung **mode** legt die Audio-Architektur des Assistenten fest. Alle drei Modi funktionieren gleichermaßen mit Prompts und Flows.

## Pipeline (Standard)

Klassische dreistufige Architektur: **Speech-to-Text → LLM → Text-to-Speech**. Wähle jede Stufe aus den Modellen, die deinem Workspace zur Verfügung stehen.

* Volle Kontrolle: Wähle STT, LLM und TTS unabhängig voneinander, inklusive Fallback-Ketten pro Stufe.
* Größte Modell- und Stimmenauswahl, beste mehrsprachige Abdeckung.
* Turn-Erkennung über ein semantisches Turn-Modell oder Sprachaktivitätserkennung (konfigurierbar).

**Nutze ihn, wenn** dir maximale Kontrolle über Qualität, Kosten und Sprachverhalten wichtig ist. Das ist die richtige Standardeinstellung für Telefonie im Produktivbetrieb.

## Realtime

Ein einzelnes **Speech-to-Speech**-Modell hört zu und spricht direkt – ohne separates STT oder TTS.

* Geringste Latenz und sehr natürliche Prosodie (Lachen, Zögern, Tonfall).
* Die Stimmenauswahl kommt aus dem Realtime-Modell.
* Die Turn-Erkennung kann robust, semantisch oder adaptiv arbeiten, wenn der gewählte Sprachmodus dies unterstützt. Andere Sprachmodi steuern das Timing automatisch.
* Weniger Stellschrauben: Stimmenbibliothek und Fallbacks pro Stufe entfallen.

**Nutze ihn, wenn** dir das Gesprächsgefühl wichtiger ist als feingranulare Kontrolle – etwa bei Demos, Concierge-Erlebnissen oder Voice-First-Produkten.

## Half-Cascade

Ein Hybrid: Ein Realtime-Modell übernimmt das **Zuhören und Denken** (rein textbasiert), während eine separate **TTS-Stimme** spricht.

Half-Cascade hat eine eigene, textfähige Realtime-Modellauswahl, unabhängig von der vollständigen Realtime-Auswahl. Eine Änderung daran wirkt sich nie auf die separate TTS-Stimme aus.

* Verständnis und Turn-Taking auf Realtime-Niveau, kombiniert mit der von dir gewählten TTS-Stimme – auch geklonte oder Markenstimmen sind möglich.
* Die Ausgabestimme konfigurierst du genau wie im Pipeline-Modus.

**Nutze ihn, wenn** du die Reaktionsfähigkeit von Realtime willst, aber eine bestimmte Stimme brauchst, die das Realtime-Modell nicht anbietet.

## Turn-Erkennung bei Realtime

Bei kompatiblen Realtime- und Half-Cascade-Assistenten legst du fest, wie der Assistent erkennt, dass der Anrufer zu Ende gesprochen hat:

* **Robust (VAD)** – reagiert nach einer klaren Pause. Schnell und vorhersehbar.
* **Semantic** – wartet, bis der Anrufer seinen Gedanken offenbar zu Ende gebracht hat, auch bei einer Pause mitten im Satz. **Response eagerness** steuert, wie früh geantwortet wird.
* **Adaptive** – kurze Bestätigungen wie „mhm“ oder „okay“ stoppen den Assistenten nicht, während eine klare Unterbrechung den Anrufer übernehmen lässt. Zusätzlich lassen sich Mindeststille, Sprachempfindlichkeit und Unterbrechungsdauer einstellen oder Unterbrechungen ganz deaktivieren.

Assistenten ohne diese Auswahlmöglichkeit steuern das Timing weiterhin automatisch. Bestehende Assistenten bleiben auf **Robust (VAD)**, bis du einen anderen Modus wählst.

## Zuverlässigkeitsverhalten

<Note>
  Ist die gewählte Realtime- oder Half-Cascade-Konfiguration vorübergehend nicht verfügbar, nutzt der Assistent nach Möglichkeit eine kompatible Ausweichoption, damit der laufende Anruf fortgesetzt werden kann.
</Note>

## Kurzvergleich

|                           | Pipeline                        | Realtime                      | Half-Cascade                    |
| ------------------------- | ------------------------------- | ----------------------------- | ------------------------------- |
| Latenz                    | Niedrig                         | Am niedrigsten                | Niedrig                         |
| Stimmenauswahl            | Vollständige Bibliothek + Klone | Modellnative Stimmen          | Vollständige Bibliothek + Klone |
| Fallbacks pro Stufe       | Ja                              | –                             | Nur TTS-Seite                   |
| Mehrsprachiges Umschalten | Ja                              | Modellabhängig                | Ja (Ausgabe)                    |
| Am besten für             | Telefonie im Produktivbetrieb   | Natürlich wirkende Erlebnisse | Realtime-Gefühl + Markenstimme  |

## Fehlerbehebung

### Kontextverlust mitten im Anruf

Der Assistent fragt nach Informationen, die er schon bekommen hat, oder scheint etwas Vorheriges vergessen zu haben. Das ist ein Verständnisproblem, kein Regler am Engine-Modus. Halte die benötigten Fakten in der [Wissensdatenbank](/de/assistants/knowledge-base) statt nur im Prompt, und nutze in einem Flow `collect`-Knoten, damit erfasste Antworten zu [Anrufvariablen](/de/assistants/variables) werden, auf die der restliche Flow zugreifen kann, statt erneut zu fragen. Wenn dein Plan dir erlaubt, das [Sprachmodell](/de/assistants/models-and-voices) selbst zu wählen, hält ein leistungsfähigeres Modell auch ein langes Gespräch zuverlässiger zusammen.

### Unnatürlicher Gesprächsverlauf

Unangenehme Pausen, der Assistent redet dem Anrufer dazwischen, oder der Austausch wirkt roboterhaft. Probiere Realtime oder Half-Cascade für natürlichere Prosodie und besseres Turn-Taking, stelle [Umgang mit Unterbrechungen und Füllphrasen](/de/assistants/conversation-quality) so ein, dass Wartezeiten überbrückt statt stumm überstanden werden, und überprüfe den oben beschriebenen Turn-Erkennungsmodus, falls der Assistent zu früh oder zu spät antwortet.

### Sich wiederholende Antworten

Der Assistent verwendet innerhalb eines Anrufs immer wieder dieselbe Formulierung oder Bestätigung. Das liegt am Prompt, nicht am Engine-Modus – ergänze eine explizite Anweisung wie „variiere deine Formulierungen, wiederhole nicht denselben Satz“ und teste ein paar unterschiedliche Gesprächsverläufe, um zu sehen, wo es erneut auftritt.

<Tip>
  Als Ausgangspunkt: **Realtime** für schnelle Vertriebs- oder Qualifizierungsanrufe, **Pipeline** für Support und detaillierte Problembehandlung, **Pipeline mit einem Flow** für Lead-Qualifizierung mit strukturierter Datenerfassung.
</Tip>
