> ## Documentation Index
> Fetch the complete documentation index at: https://docs.famulor.io/llms.txt
> Use this file to discover all available pages before exploring further.

# Modes du moteur

> Pipeline, Realtime et Half-Cascade — comment votre assistant écoute et parle

Le paramètre **mode** détermine l'architecture audio de l'assistant. Les trois modes fonctionnent aussi bien avec des prompts qu'avec des flux.

## Pipeline (par défaut)

Architecture classique en trois étapes : **reconnaissance vocale → LLM → synthèse vocale**. Choisissez chaque étape parmi les modèles disponibles pour votre espace de travail.

* Contrôle total : choisissez le STT, le LLM et le TTS indépendamment, avec des chaînes de secours pour chaque étape.
* Le plus large choix de modèles et de voix, la meilleure couverture multilingue.
* Détection de tour de parole via un modèle de détection sémantique ou une détection d'activité vocale (configurable).

**À utiliser** quand vous voulez un contrôle maximal sur la qualité, les coûts et le comportement linguistique. C'est le bon choix par défaut pour la téléphonie en production.

## Realtime

Un seul modèle **voix-à-voix** écoute et parle directement — sans STT ni TTS séparés.

* Latence minimale et prosodie très naturelle (rires, hésitations, intonation).
* Le choix de la voix dépend du modèle Realtime utilisé.
* La détection de tour de parole peut être robuste, sémantique ou adaptative lorsque le mode vocal sélectionné le permet. Les autres modes vocaux gèrent le rythme des tours automatiquement.
* Moins de réglages disponibles : la bibliothèque de voix et les solutions de secours par étape ne s'appliquent pas.

**À utiliser** quand le naturel de la conversation compte plus qu'un contrôle fin : démos, expériences de conciergerie, produits centrés sur la voix.

## Half-Cascade

Une architecture hybride : un modèle Realtime s'occupe de **l'écoute et de la réflexion** (en texte uniquement), tandis qu'une **voix TTS** distincte se charge de la parole.

Half-Cascade dispose de sa propre sélection de modèle Realtime capable de texte, indépendante de la sélection Realtime complète. La modifier ne change jamais la voix TTS séparée.

* Compréhension et gestion des tours de parole dignes du Realtime, combinées à la voix TTS de votre choix — y compris les voix clonées ou de marque.
* La voix de sortie se configure exactement comme en mode Pipeline.

**À utiliser** quand vous voulez la réactivité du Realtime tout en ayant besoin d'une voix spécifique que le modèle Realtime ne propose pas.

## Détection de tour de parole en Realtime

Pour les assistants Realtime et Half-Cascade compatibles, choisissez comment l'assistant détecte que l'appelant a fini de parler :

* **Robust (VAD)** — répond après une pause nette. Rapide et prévisible.
* **Semantic** — attend que l'appelant semble avoir terminé son idée, même en cas de pause au milieu d'une phrase. **Response eagerness** détermine la rapidité de la réponse.
* **Adaptive** — les courtes marques d'écoute comme « mhm » ou « d'accord » n'arrêtent pas l'assistant, tandis qu'une véritable interruption laisse l'appelant reprendre la parole. Vous pouvez aussi régler le silence minimal, la sensibilité vocale, la durée d'interruption, ou désactiver les interruptions.

Les assistants qui ne proposent pas ces options continuent de gérer le rythme des tours automatiquement. Les assistants existants restent en **Robust (VAD)** jusqu'à ce que vous choisissiez un autre mode.

## Comportement de fiabilité

<Note>
  Si la configuration Realtime ou Half-Cascade sélectionnée est temporairement indisponible, l'assistant utilise une solution de repli compatible si possible, afin que l'appel en cours puisse continuer.
</Note>

## Comparatif rapide

|                                | Pipeline                       | Realtime               | Half-Cascade                        |
| ------------------------------ | ------------------------------ | ---------------------- | ----------------------------------- |
| Latence                        | Faible                         | Minimale               | Faible                              |
| Choix de la voix               | Bibliothèque complète + clones | Voix natives du modèle | Bibliothèque complète + clones      |
| Solutions de secours par étape | Oui                            | —                      | Côté TTS uniquement                 |
| Changement de langue           | Oui                            | Selon le modèle        | Oui (en sortie)                     |
| Idéal pour                     | Téléphonie en production       | Expériences au naturel | Sensation Realtime + voix de marque |

## Dépannage

### Perte de contexte en cours d'appel

L'assistant redemande une information déjà donnée, ou semble avoir manqué quelque chose dit plus tôt. C'est un problème de compréhension, pas un réglage lié au mode du moteur. Conservez les informations dont il a besoin dans la [base de connaissances](/fr/assistants/knowledge-base) plutôt que dans le seul prompt, et dans un flux, utilisez des nœuds `collect` pour que les réponses capturées deviennent des [variables d'appel](/fr/assistants/variables) que le reste du flux peut réutiliser au lieu de redemander. Si votre forfait vous permet de choisir vous-même le [modèle de langage](/fr/assistants/models-and-voices), un modèle plus performant tient aussi mieux une conversation longue dans la durée.

### Déroulement de conversation peu naturel

Pauses gênantes, l'assistant qui parle en même temps que l'appelant, ou un échange qui sonne mécanique. Essayez Realtime ou Half-Cascade pour une prosodie et une gestion des tours plus naturelles, ajustez la [gestion des interruptions et les phrases de remplissage](/fr/assistants/conversation-quality) pour que les temps d'attente soient comblés plutôt que silencieux, et revoyez le mode de détection de tour de parole ci-dessus si l'assistant répond trop tôt ou trop tard.

### Réponses répétitives

L'assistant réutilise la même formulation ou confirmation au cours d'un appel. Cela vient du prompt, pas du mode du moteur — ajoutez une instruction explicite comme « variez vos formulations, ne répétez pas deux fois la même phrase » et testez plusieurs déroulements de conversation différents pour voir où cela se reproduit.

<Tip>
  Pour commencer : **Realtime** pour des appels de vente ou de qualification rapides, **Pipeline** pour le support et le dépannage détaillé, **Pipeline with a flow** pour la qualification de leads nécessitant une collecte de données structurée.
</Tip>
