Pipeline (predeterminado)
Arquitectura clásica de tres etapas: voz a texto → LLM → texto a voz. Elige cada etapa entre los modelos disponibles para tu espacio de trabajo.- Control total: elige el STT, el LLM y el TTS de forma independiente, incluidas las cadenas de respaldo por etapa.
- La selección de modelos y voces más amplia, con la mejor cobertura multilingüe.
- Detección de turno mediante un modelo de turno semántico o detección de actividad de voz (configurable).
Realtime
Un único modelo de voz a voz escucha y habla directamente — sin STT ni TTS por separado.- Latencia mínima y una prosodia muy natural (risas, dudas, tono).
- La voz se elige entre las que ofrece el propio modelo en tiempo real.
- La detección de turno puede ser robusta, semántica o adaptativa cuando el modo de voz seleccionado lo admite. El resto de modos de voz gestionan el ritmo de los turnos automáticamente.
- Menos opciones de ajuste: la biblioteca de voces y los respaldos por etapa no aplican.
Half-cascade
Un híbrido: un modelo en tiempo real se encarga de escuchar y pensar (solo texto), mientras que una voz TTS independiente se encarga de hablar. Half-cascade tiene su propia selección de modelo en tiempo real con capacidad de texto, independiente de la selección de Realtime completo. Cambiarla nunca modifica la voz TTS independiente.- Comprensión y manejo de turnos con calidad de tiempo real, combinados con la voz TTS que elijas, incluidas voces clonadas o de marca.
- La voz de salida se configura exactamente igual que en el modo Pipeline.
Detección de turno en tiempo real
Para asistentes Realtime y Half-cascade compatibles, elige cómo decide el asistente que quien llama ha terminado de hablar:- Robust (VAD) — responde tras una pausa clara. Rápido y predecible.
- Semantic — espera hasta que quien llama parece haber terminado su idea, incluso con una pausa a mitad de frase. Response eagerness controla con cuánta rapidez responde.
- Adaptive — expresiones breves como «mhm» o «vale» no detienen al asistente, mientras que una interrupción clara deja que quien llama tome la palabra. También puedes ajustar el silencio mínimo, la sensibilidad de voz, la duración de interrupción, o desactivar las interrupciones.
Comportamiento de fiabilidad
Si la configuración de Realtime o Half-cascade elegida no está disponible temporalmente, el asistente usa una alternativa compatible cuando sea posible para que la llamada en curso pueda continuar.
Comparación rápida
Solución de problemas
Se pierde el contexto a mitad de llamada
El asistente pide información que ya se le dio, o parece haber pasado por alto algo dicho antes. Esto es un problema de comprensión, no un ajuste del modo de motor. Mantén los datos que necesita en la base de conocimientos en lugar de solo en el prompt, y en un flujo, usa nodoscollect para que las respuestas capturadas se conviertan en variables de llamada que el resto del flujo pueda usar en lugar de volver a preguntar. Si tu plan te permite elegir tú mismo el modelo de lenguaje, uno más potente también mantiene mejor el hilo de una conversación larga.