Skip to main content

El catálogo de modelos

Los asistentes no dependen de un proveedor fijo: eligen de un catálogo de modelos seleccionado que cubre cuatro tipos: Solo el administrador de la plataforma controla la disponibilidad. Habilita modelos globalmente, puede permitirlos o bloquearlos por usuario y define los modos de motor compatibles. Los administradores del espacio de trabajo no pueden omitir el catálogo. Con el complemento Fallbacks & Guardrails, el editor muestra selectores de proveedor y modelo. Pipeline, tiempo real y half-cascade guardan selecciones independientes. La opción predeterminada almacena null, de modo que los cambios del administrador se aplican automáticamente: selección del asistente, valor personal, valor de plataforma y respaldo seguro. Sin Fallbacks & Guardrails, el editor sigue siendo automático y los valores personales continúan aplicándose.
Busca la insignia Recomendado: son los modelos que más probamos y para los que ajustamos los valores predeterminados. Baja latencia marca los modelos pensados para conversaciones telefónicas ágiles.

La biblioteca de voces

El selector de voces carga el catálogo completo y paginado de cada proveedor de TTS habilitado, filtrable por idioma y género, con vistas previas de audio instantáneas: pulsa reproducir para escuchar una muestra antes de confirmar. Las voces de ElevenLabs con tarifas personalizadas o multiplicadores de créditos quedan excluidas, así que toda voz de ElevenLabs que veas en el selector usa la tarifa estándar del proveedor.
  • Voz por asistente: la voz predeterminada para hablar.
  • Anulación de voz por agente de flow: cada agente de flow puede hablar con una voz distinta (por ejemplo, una voz propia para el agente “especialista en ventas”).
  • Voz por idioma: con el cambio automático de idioma, asignas una voz a cada idioma para que el asistente cambie de voz junto con el idioma.
  • Voces clonadas: según tu plan, puedes añadir clones personalizados y usarlos como cualquier voz de la biblioteca. Un clon es privado para la cuenta que lo creó: el resto de miembros del mismo espacio de trabajo no pueden verlo ni seleccionarlo. El límite del plan se cuenta por usuario.

Estilo de habla

Ajusta la salida sin cambiar de voz:
  • Velocidad de habla: de algo más lenta a más rápida que la neutral.
  • Volumen de salida: ajuste de nivel para voces bajas o altas.
  • Diccionario de pronunciación: mapeo de clave-valor por asistente, por ejemplo "API" → "A P I" o el nombre de tu empresa deletreado fonéticamente. Se aplica a toda la salida hablada.
  • Filtros de markdown y emojis: activados por defecto para que los artefactos de formato del LLM nunca se lean en voz alta.

Cadenas de respaldo (Fallbacks & Guardrails)

Para mayor fiabilidad en producción puedes definir una cadena de respaldo por etapa: si el proveedor principal falla a mitad de la llamada, el motor cambia a la siguiente entrada y la llamada continúa sin interrupciones.
  • STT — por ejemplo Deepgram nova-3 → AssemblyAI universal-streaming
  • LLM — por ejemplo GPT → Groq
  • TTS — por ejemplo Cartesia sonic → ElevenLabs (cada entrada puede especificar su propia voz)
Los cambios de estado del proveedor se registran como eventos de la llamada, así que después puedes ver si se activó algún respaldo. Los respaldos son una función limitada por plan.
Incluso sin respaldos configurados, una configuración rota nunca corta una llamada: el motor recurre a una pila predeterminada segura y registra un evento config_error.