Skip to main content
La configuración de mode controla la arquitectura de audio del asistente. Los tres modos funcionan igual con prompts y con flujos.

Pipeline (predeterminado)

Arquitectura clásica de tres etapas: voz a texto → LLM → texto a voz. Elige cada etapa entre los modelos disponibles para tu espacio de trabajo.
  • Control total: elige el STT, el LLM y el TTS de forma independiente, incluidas las cadenas de respaldo por etapa.
  • La selección de modelos y voces más amplia, con la mejor cobertura multilingüe.
  • Detección de turno mediante un modelo de turno semántico o detección de actividad de voz (configurable).
Úsalo cuando quieras el máximo control sobre la calidad, el costo y el comportamiento del idioma. Es la opción predeterminada adecuada para telefonía en producción.

Realtime

Un único modelo de voz a voz escucha y habla directamente — sin STT ni TTS por separado.
  • Latencia mínima y una prosodia muy natural (risas, dudas, tono).
  • La voz se elige entre las que ofrece el propio modelo en tiempo real.
  • La detección de turno puede ser robusta, semántica o adaptativa cuando el modo de voz seleccionado lo admite. El resto de modos de voz gestionan el ritmo de los turnos automáticamente.
  • Menos opciones de ajuste: la biblioteca de voces y los respaldos por etapa no aplican.
Úsalo cuando la naturalidad de la conversación importe más que el control fino: demos, experiencias de conserjería, productos donde la voz es lo principal.

Half-cascade

Un híbrido: un modelo en tiempo real se encarga de escuchar y pensar (solo texto), mientras que una voz TTS independiente se encarga de hablar. Half-cascade tiene su propia selección de modelo en tiempo real con capacidad de texto, independiente de la selección de Realtime completo. Cambiarla nunca modifica la voz TTS independiente.
  • Comprensión y manejo de turnos con calidad de tiempo real, combinados con la voz TTS que elijas, incluidas voces clonadas o de marca.
  • La voz de salida se configura exactamente igual que en el modo Pipeline.
Úsalo cuando necesites la capacidad de respuesta del tiempo real pero con una voz concreta que el modelo en tiempo real no ofrece.

Detección de turno en tiempo real

Para asistentes Realtime y Half-cascade compatibles, elige cómo decide el asistente que quien llama ha terminado de hablar:
  • Robust (VAD) — responde tras una pausa clara. Rápido y predecible.
  • Semantic — espera hasta que quien llama parece haber terminado su idea, incluso con una pausa a mitad de frase. Response eagerness controla con cuánta rapidez responde.
  • Adaptive — expresiones breves como «mhm» o «vale» no detienen al asistente, mientras que una interrupción clara deja que quien llama tome la palabra. También puedes ajustar el silencio mínimo, la sensibilidad de voz, la duración de interrupción, o desactivar las interrupciones.
Los asistentes que no ofrecen estas opciones siguen gestionando el ritmo de los turnos automáticamente. Los asistentes existentes permanecen en Robust (VAD) hasta que elijas otro modo.

Comportamiento de fiabilidad

Si la configuración de Realtime o Half-cascade elegida no está disponible temporalmente, el asistente usa una alternativa compatible cuando sea posible para que la llamada en curso pueda continuar.

Comparación rápida

Solución de problemas

Se pierde el contexto a mitad de llamada

El asistente pide información que ya se le dio, o parece haber pasado por alto algo dicho antes. Esto es un problema de comprensión, no un ajuste del modo de motor. Mantén los datos que necesita en la base de conocimientos en lugar de solo en el prompt, y en un flujo, usa nodos collect para que las respuestas capturadas se conviertan en variables de llamada que el resto del flujo pueda usar en lugar de volver a preguntar. Si tu plan te permite elegir tú mismo el modelo de lenguaje, uno más potente también mantiene mejor el hilo de una conversación larga.

Flujo de conversación poco natural

Pausas incómodas, el asistente hablando por encima de quien llama, o un intercambio que suena mecánico. Prueba Realtime o Half-cascade para una prosodia y una gestión de turnos más naturales, ajusta la gestión de interrupciones y las frases de relleno para que las esperas se rellenen en lugar de quedar en silencio, y revisa el modo de detección de turno anterior si el asistente responde demasiado pronto o demasiado tarde.

Respuestas repetitivas

El asistente reutiliza la misma formulación o confirmación durante una llamada. Esto viene del prompt, no del modo de motor: añade una instrucción explícita como «varía tu forma de expresarte, no repitas la misma frase dos veces» y prueba varios caminos de conversación distintos para ver dónde se repite.
Como punto de partida: Realtime para llamadas de venta o cualificación rápidas, Pipeline para soporte y resolución de problemas detallada, Pipeline con un flujo para cualificación de leads que necesite captura de datos estructurada.