Pipeline (par défaut)
Architecture classique en trois étapes : reconnaissance vocale → LLM → synthèse vocale. Choisissez chaque étape parmi les modèles disponibles pour votre espace de travail.- Contrôle total : choisissez le STT, le LLM et le TTS indépendamment, avec des chaînes de secours pour chaque étape.
- Le plus large choix de modèles et de voix, la meilleure couverture multilingue.
- Détection de tour de parole via un modèle de détection sémantique ou une détection d’activité vocale (configurable).
Realtime
Un seul modèle voix-à-voix écoute et parle directement — sans STT ni TTS séparés.- Latence minimale et prosodie très naturelle (rires, hésitations, intonation).
- Le choix de la voix dépend du modèle Realtime utilisé.
- La détection de tour de parole peut être robuste, sémantique ou adaptative lorsque le mode vocal sélectionné le permet. Les autres modes vocaux gèrent le rythme des tours automatiquement.
- Moins de réglages disponibles : la bibliothèque de voix et les solutions de secours par étape ne s’appliquent pas.
Half-Cascade
Une architecture hybride : un modèle Realtime s’occupe de l’écoute et de la réflexion (en texte uniquement), tandis qu’une voix TTS distincte se charge de la parole. Half-Cascade dispose de sa propre sélection de modèle Realtime capable de texte, indépendante de la sélection Realtime complète. La modifier ne change jamais la voix TTS séparée.- Compréhension et gestion des tours de parole dignes du Realtime, combinées à la voix TTS de votre choix — y compris les voix clonées ou de marque.
- La voix de sortie se configure exactement comme en mode Pipeline.
Détection de tour de parole en Realtime
Pour les assistants Realtime et Half-Cascade compatibles, choisissez comment l’assistant détecte que l’appelant a fini de parler :- Robust (VAD) — répond après une pause nette. Rapide et prévisible.
- Semantic — attend que l’appelant semble avoir terminé son idée, même en cas de pause au milieu d’une phrase. Response eagerness détermine la rapidité de la réponse.
- Adaptive — les courtes marques d’écoute comme « mhm » ou « d’accord » n’arrêtent pas l’assistant, tandis qu’une véritable interruption laisse l’appelant reprendre la parole. Vous pouvez aussi régler le silence minimal, la sensibilité vocale, la durée d’interruption, ou désactiver les interruptions.
Comportement de fiabilité
Si la configuration Realtime ou Half-Cascade sélectionnée est temporairement indisponible, l’assistant utilise une solution de repli compatible si possible, afin que l’appel en cours puisse continuer.
Comparatif rapide
Dépannage
Perte de contexte en cours d’appel
L’assistant redemande une information déjà donnée, ou semble avoir manqué quelque chose dit plus tôt. C’est un problème de compréhension, pas un réglage lié au mode du moteur. Conservez les informations dont il a besoin dans la base de connaissances plutôt que dans le seul prompt, et dans un flux, utilisez des nœudscollect pour que les réponses capturées deviennent des variables d’appel que le reste du flux peut réutiliser au lieu de redemander. Si votre forfait vous permet de choisir vous-même le modèle de langage, un modèle plus performant tient aussi mieux une conversation longue dans la durée.