> ## Documentation Index
> Fetch the complete documentation index at: https://docs.ouraicalling.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Modos del motor

> Pipeline, Realtime y Half-cascade: cómo escucha y habla tu asistente

La configuración de **modo** controla la arquitectura de audio del asistente. Los tres modos funcionan igual tanto con Prompts como con Flows.

## Pipeline (predeterminado)

Arquitectura clásica de tres etapas: **voz a texto → LLM → texto a voz**. Cada etapa es un modelo que se elige por separado en el [catálogo de modelos](/assistants/models-and-voices).

* Control total: elige el STT, el LLM y el TTS de forma independiente, incluidas las cadenas de respaldo por etapa.
* La selección de modelos y voces más amplia, con la mejor cobertura multilingüe.
* Detección de turno mediante un modelo de turno semántico o detección de actividad de voz (configurable).

**Úsalo cuando** quieras el máximo control sobre calidad, costo y comportamiento del idioma. Es la opción predeterminada correcta para telefonía en producción.

## Realtime

Un único modelo de **voz a voz** (por ejemplo, `gpt-realtime` de OpenAI o Google Gemini Live) escucha y habla directamente, sin STT ni TTS por separado.

* Latencia mínima y una prosodia muy natural (risas, dudas, tono).
* La voz se elige entre las del propio modelo en tiempo real (por ejemplo, `marin`, `cedar` en OpenAI; `Puck`, `Kore` en Gemini).
* La detección de turno ocurre en el servidor, dentro del modelo.
* Menos opciones de ajuste: la biblioteca de voces, los respaldos por etapa y parte del ajuste de interrupciones no aplican.

**Úsalo cuando** la naturalidad de la conversación importe más que el control fino: demos, experiencias de conserjería, productos donde la voz es lo principal.

## Half-cascade

Un híbrido: un modelo en tiempo real se encarga de **escuchar y pensar** (solo texto), mientras una **voz TTS** independiente se encarga de hablar.

* Comprensión y manejo de turnos con calidad de tiempo real, combinados con la voz TTS que elijas, incluidas voces clonadas o de marca.
* La voz de salida se configura exactamente igual que en el modo Pipeline (`proveedor / modelo / voz de TTS`).

**Úsalo cuando** necesites la capacidad de respuesta del tiempo real pero con una voz concreta que el modelo en tiempo real no ofrece.

## Comportamiento de fiabilidad

<Note>
  Si no se puede montar una configuración de Realtime o Half-cascade en el momento de la llamada (falta la clave del proveedor, modelo no disponible), la llamada **no falla**: el motor recurre automáticamente a la pila de Pipeline y registra el evento en el historial de llamadas. Un problema de configuración nunca corta una llamada en curso.
</Note>

## Comparación rápida

|                     | Pipeline                     | Realtime                           | Half-cascade                            |
| ------------------- | ---------------------------- | ---------------------------------- | --------------------------------------- |
| Latencia            | Baja                         | La más baja                        | Baja                                    |
| Selección de voz    | Biblioteca completa + clones | Voces nativas del modelo           | Biblioteca completa + clones            |
| Respaldos por etapa | Sí                           | —                                  | Solo en el lado TTS                     |
| Cambio de idioma    | Sí                           | Según el modelo                    | Sí (en la salida)                       |
| Ideal para          | Telefonía en producción      | Experiencias con sensación natural | Sensación de tiempo real + voz de marca |
