El catálogo de modelos
Los asistentes no dependen de un proveedor fijo: eligen de un catálogo de modelos seleccionado que cubre cuatro tipos:
Solo el administrador de la plataforma controla la disponibilidad. Habilita
modelos globalmente, puede permitirlos o bloquearlos por usuario y define los
modos de motor compatibles. Los administradores del espacio de trabajo no
pueden omitir el catálogo.
Con el complemento Fallbacks & Guardrails, el editor muestra selectores de proveedor y modelo. Pipeline,
tiempo real y half-cascade guardan selecciones independientes. La opción
predeterminada almacena
null, de modo que los cambios del administrador se
aplican automáticamente: selección del asistente, valor personal, valor de
plataforma y respaldo seguro. Sin Fallbacks & Guardrails, el editor sigue siendo automático y los
valores personales continúan aplicándose.
La biblioteca de voces
El selector de voces carga el catálogo completo y paginado de cada proveedor de TTS habilitado, filtrable por idioma y género, con vistas previas de audio instantáneas: pulsa reproducir para escuchar una muestra antes de confirmar. Las voces de ElevenLabs con tarifas personalizadas o multiplicadores de créditos quedan excluidas, así que toda voz de ElevenLabs que veas en el selector usa la tarifa estándar del proveedor.- Voz por asistente: la voz predeterminada para hablar.
- Anulación de voz por agente de flow: cada agente de flow puede hablar con una voz distinta (por ejemplo, una voz propia para el agente “especialista en ventas”).
- Voz por idioma: con el cambio automático de idioma, asignas una voz a cada idioma para que el asistente cambie de voz junto con el idioma.
- Voces clonadas: según tu plan, puedes añadir clones personalizados y usarlos como cualquier voz de la biblioteca. Un clon es privado para la cuenta que lo creó: el resto de miembros del mismo espacio de trabajo no pueden verlo ni seleccionarlo. El límite del plan se cuenta por usuario.
Estilo de habla
Ajusta la salida sin cambiar de voz:- Velocidad de habla: de algo más lenta a más rápida que la neutral.
- Volumen de salida: ajuste de nivel para voces bajas o altas.
- Diccionario de pronunciación: mapeo de clave-valor por asistente, por ejemplo
"API" → "A P I"o el nombre de tu empresa deletreado fonéticamente. Se aplica a toda la salida hablada. - Filtros de markdown y emojis: activados por defecto para que los artefactos de formato del LLM nunca se lean en voz alta.
Cadenas de respaldo (Fallbacks & Guardrails)
Para mayor fiabilidad en producción puedes definir una cadena de respaldo por etapa: si el proveedor principal falla a mitad de la llamada, el motor cambia a la siguiente entrada y la llamada continúa sin interrupciones.- STT — por ejemplo
Deepgram nova-3 → AssemblyAI universal-streaming - LLM — por ejemplo
GPT → Groq - TTS — por ejemplo
Cartesia sonic → ElevenLabs(cada entrada puede especificar su propia voz)
Incluso sin respaldos configurados, una configuración rota nunca corta una llamada: el motor recurre a una pila predeterminada segura y registra un evento
config_error.