> ## Documentation Index
> Fetch the complete documentation index at: https://docs.famulor.io/llms.txt
> Use this file to discover all available pages before exploring further.

# Modos del motor

> Pipeline, Realtime y Half-cascade: cómo escucha y habla tu asistente

La configuración de **mode** controla la arquitectura de audio del asistente. Los tres modos funcionan igual con prompts y con flujos.

## Pipeline (predeterminado)

Arquitectura clásica de tres etapas: **voz a texto → LLM → texto a voz**. Elige cada etapa entre los modelos disponibles para tu espacio de trabajo.

* Control total: elige el STT, el LLM y el TTS de forma independiente, incluidas las cadenas de respaldo por etapa.
* La selección de modelos y voces más amplia, con la mejor cobertura multilingüe.
* Detección de turno mediante un modelo de turno semántico o detección de actividad de voz (configurable).

**Úsalo cuando** quieras el máximo control sobre la calidad, el costo y el comportamiento del idioma. Es la opción predeterminada adecuada para telefonía en producción.

## Realtime

Un único modelo de **voz a voz** escucha y habla directamente — sin STT ni TTS por separado.

* Latencia mínima y una prosodia muy natural (risas, dudas, tono).
* La voz se elige entre las que ofrece el propio modelo en tiempo real.
* La detección de turno puede ser robusta, semántica o adaptativa cuando el modo de voz seleccionado lo admite. El resto de modos de voz gestionan el ritmo de los turnos automáticamente.
* Menos opciones de ajuste: la biblioteca de voces y los respaldos por etapa no aplican.

**Úsalo cuando** la naturalidad de la conversación importe más que el control fino: demos, experiencias de conserjería, productos donde la voz es lo principal.

## Half-cascade

Un híbrido: un modelo en tiempo real se encarga de **escuchar y pensar** (solo texto), mientras que una **voz TTS** independiente se encarga de hablar.

Half-cascade tiene su propia selección de modelo en tiempo real con capacidad de texto, independiente de la selección de Realtime completo. Cambiarla nunca modifica la voz TTS independiente.

* Comprensión y manejo de turnos con calidad de tiempo real, combinados con la voz TTS que elijas, incluidas voces clonadas o de marca.
* La voz de salida se configura exactamente igual que en el modo Pipeline.

**Úsalo cuando** necesites la capacidad de respuesta del tiempo real pero con una voz concreta que el modelo en tiempo real no ofrece.

## Detección de turno en tiempo real

Para asistentes Realtime y Half-cascade compatibles, elige cómo decide el asistente que quien llama ha terminado de hablar:

* **Robust (VAD)** — responde tras una pausa clara. Rápido y predecible.
* **Semantic** — espera hasta que quien llama parece haber terminado su idea, incluso con una pausa a mitad de frase. **Response eagerness** controla con cuánta rapidez responde.
* **Adaptive** — expresiones breves como «mhm» o «vale» no detienen al asistente, mientras que una interrupción clara deja que quien llama tome la palabra. También puedes ajustar el silencio mínimo, la sensibilidad de voz, la duración de interrupción, o desactivar las interrupciones.

Los asistentes que no ofrecen estas opciones siguen gestionando el ritmo de los turnos automáticamente. Los asistentes existentes permanecen en **Robust (VAD)** hasta que elijas otro modo.

## Comportamiento de fiabilidad

<Note>
  Si la configuración de Realtime o Half-cascade elegida no está disponible temporalmente, el asistente usa una alternativa compatible cuando sea posible para que la llamada en curso pueda continuar.
</Note>

## Comparación rápida

|                     | Pipeline                     | Realtime                           | Half-cascade                            |
| ------------------- | ---------------------------- | ---------------------------------- | --------------------------------------- |
| Latencia            | Baja                         | La más baja                        | Baja                                    |
| Selección de voz    | Biblioteca completa + clones | Voces nativas del modelo           | Biblioteca completa + clones            |
| Respaldos por etapa | Sí                           | —                                  | Solo en el lado TTS                     |
| Cambio de idioma    | Sí                           | Según el modelo                    | Sí (en la salida)                       |
| Ideal para          | Telefonía en producción      | Experiencias con sensación natural | Sensación de tiempo real + voz de marca |

## Solución de problemas

### Se pierde el contexto a mitad de llamada

El asistente pide información que ya se le dio, o parece haber pasado por alto algo dicho antes. Esto es un problema de comprensión, no un ajuste del modo de motor. Mantén los datos que necesita en la [base de conocimientos](/es/assistants/knowledge-base) en lugar de solo en el prompt, y en un flujo, usa nodos `collect` para que las respuestas capturadas se conviertan en [variables de llamada](/es/assistants/variables) que el resto del flujo pueda usar en lugar de volver a preguntar. Si tu plan te permite elegir tú mismo el [modelo de lenguaje](/es/assistants/models-and-voices), uno más potente también mantiene mejor el hilo de una conversación larga.

### Flujo de conversación poco natural

Pausas incómodas, el asistente hablando por encima de quien llama, o un intercambio que suena mecánico. Prueba Realtime o Half-cascade para una prosodia y una gestión de turnos más naturales, ajusta la [gestión de interrupciones y las frases de relleno](/es/assistants/conversation-quality) para que las esperas se rellenen en lugar de quedar en silencio, y revisa el modo de detección de turno anterior si el asistente responde demasiado pronto o demasiado tarde.

### Respuestas repetitivas

El asistente reutiliza la misma formulación o confirmación durante una llamada. Esto viene del prompt, no del modo de motor: añade una instrucción explícita como «varía tu forma de expresarte, no repitas la misma frase dos veces» y prueba varios caminos de conversación distintos para ver dónde se repite.

<Tip>
  Como punto de partida: **Realtime** para llamadas de venta o cualificación rápidas, **Pipeline** para soporte y resolución de problemas detallada, **Pipeline con un flujo** para cualificación de leads que necesite captura de datos estructurada.
</Tip>
