Pipeline (predeterminado)
Arquitectura clásica de tres etapas: voz a texto → LLM → texto a voz. Cada etapa es un modelo que se elige por separado en el catálogo de modelos.- Control total: elige el STT, el LLM y el TTS de forma independiente, incluidas las cadenas de respaldo por etapa.
- La selección de modelos y voces más amplia, con la mejor cobertura multilingüe.
- Detección de turno mediante un modelo de turno semántico o detección de actividad de voz (configurable).
Realtime
Un único modelo de voz a voz (por ejemplo,gpt-realtime de OpenAI o Google Gemini Live) escucha y habla directamente, sin STT ni TTS por separado.
- Latencia mínima y una prosodia muy natural (risas, dudas, tono).
- La voz se elige entre las del propio modelo en tiempo real (por ejemplo,
marin,cedaren OpenAI;Puck,Koreen Gemini). - La detección de turno ocurre en el servidor, dentro del modelo.
- Menos opciones de ajuste: la biblioteca de voces, los respaldos por etapa y parte del ajuste de interrupciones no aplican.
Half-cascade
Un híbrido: un modelo en tiempo real se encarga de escuchar y pensar (solo texto), mientras una voz TTS independiente se encarga de hablar.- Comprensión y manejo de turnos con calidad de tiempo real, combinados con la voz TTS que elijas, incluidas voces clonadas o de marca.
- La voz de salida se configura exactamente igual que en el modo Pipeline (
proveedor / modelo / voz de TTS).
Comportamiento de fiabilidad
Si no se puede montar una configuración de Realtime o Half-cascade en el momento de la llamada (falta la clave del proveedor, modelo no disponible), la llamada no falla: el motor recurre automáticamente a la pila de Pipeline y registra el evento en el historial de llamadas. Un problema de configuración nunca corta una llamada en curso.