Skip to main content
La configuración de modo controla la arquitectura de audio del asistente. Los tres modos funcionan igual tanto con Prompts como con Flows.

Pipeline (predeterminado)

Arquitectura clásica de tres etapas: voz a texto → LLM → texto a voz. Cada etapa es un modelo que se elige por separado en el catálogo de modelos.
  • Control total: elige el STT, el LLM y el TTS de forma independiente, incluidas las cadenas de respaldo por etapa.
  • La selección de modelos y voces más amplia, con la mejor cobertura multilingüe.
  • Detección de turno mediante un modelo de turno semántico o detección de actividad de voz (configurable).
Úsalo cuando quieras el máximo control sobre calidad, costo y comportamiento del idioma. Es la opción predeterminada correcta para telefonía en producción.

Realtime

Un único modelo de voz a voz (por ejemplo, gpt-realtime de OpenAI o Google Gemini Live) escucha y habla directamente, sin STT ni TTS por separado.
  • Latencia mínima y una prosodia muy natural (risas, dudas, tono).
  • La voz se elige entre las del propio modelo en tiempo real (por ejemplo, marin, cedar en OpenAI; Puck, Kore en Gemini).
  • La detección de turno ocurre en el servidor, dentro del modelo.
  • Menos opciones de ajuste: la biblioteca de voces, los respaldos por etapa y parte del ajuste de interrupciones no aplican.
Úsalo cuando la naturalidad de la conversación importe más que el control fino: demos, experiencias de conserjería, productos donde la voz es lo principal.

Half-cascade

Un híbrido: un modelo en tiempo real se encarga de escuchar y pensar (solo texto), mientras una voz TTS independiente se encarga de hablar.
  • Comprensión y manejo de turnos con calidad de tiempo real, combinados con la voz TTS que elijas, incluidas voces clonadas o de marca.
  • La voz de salida se configura exactamente igual que en el modo Pipeline (proveedor / modelo / voz de TTS).
Úsalo cuando necesites la capacidad de respuesta del tiempo real pero con una voz concreta que el modelo en tiempo real no ofrece.

Comportamiento de fiabilidad

Si no se puede montar una configuración de Realtime o Half-cascade en el momento de la llamada (falta la clave del proveedor, modelo no disponible), la llamada no falla: el motor recurre automáticamente a la pila de Pipeline y registra el evento en el historial de llamadas. Un problema de configuración nunca corta una llamada en curso.

Comparación rápida