> ## Documentation Index
> Fetch the complete documentation index at: https://docs.ouraicalling.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelos y voces

> El catálogo de modelos, la biblioteca de voces con vistas previas y las cadenas de respaldo

## El catálogo de modelos

Los asistentes no dependen de un proveedor fijo: eligen de un **catálogo de modelos seleccionado** que cubre cuatro tipos:

| Tipo        | Proveedores (ejemplos)                      |
| ----------- | ------------------------------------------- |
| LLM         | OpenAI, Anthropic, Google, Groq, Azure      |
| Voz a texto | Deepgram, OpenAI, Google, Azure             |
| Texto a voz | Cartesia, ElevenLabs, OpenAI, Google, Azure |
| Tiempo real | OpenAI (gpt-realtime), Google (Gemini Live) |

Solo el **administrador de la plataforma** controla la disponibilidad. Habilita
modelos globalmente, puede permitirlos o bloquearlos por usuario y define los
modos de motor compatibles. Los administradores del espacio de trabajo no
pueden omitir el catálogo.

Con el complemento Fallbacks & Guardrails, el editor muestra selectores de proveedor y modelo. Pipeline,
tiempo real y half-cascade guardan selecciones independientes. La opción
predeterminada almacena `null`, de modo que los cambios del administrador se
aplican automáticamente: selección del asistente, valor personal, valor de
plataforma y respaldo seguro. Sin Fallbacks & Guardrails, el editor sigue siendo automático y los
valores personales continúan aplicándose.

<Tip>
  Busca la insignia **Recomendado**: son los modelos que más probamos y para los que ajustamos los valores predeterminados. **Baja latencia** marca los modelos pensados para conversaciones telefónicas ágiles.
</Tip>

## La biblioteca de voces

El selector de voces carga el catálogo completo y paginado de cada proveedor de TTS habilitado, filtrable por idioma y género, **con vistas previas de audio instantáneas**: pulsa reproducir para escuchar una muestra antes de confirmar.

Las voces de ElevenLabs con tarifas personalizadas o multiplicadores de créditos quedan excluidas, así que toda voz de ElevenLabs que veas en el selector usa la tarifa estándar del proveedor.

* **Voz por asistente**: la voz predeterminada para hablar.
* **Anulación de voz por agente de flow**: cada agente de [flow](/flow-builder/nodes) puede hablar con una voz distinta (por ejemplo, una voz propia para el agente "especialista en ventas").
* **Voz por idioma**: con el [cambio automático de idioma](/assistants/languages), asignas una voz a cada idioma para que el asistente cambie de voz junto con el idioma.
* **Voces clonadas**: según tu plan, puedes añadir clones personalizados y usarlos como cualquier voz de la biblioteca. Un clon es privado para la cuenta que lo creó: el resto de miembros del mismo espacio de trabajo no pueden verlo ni seleccionarlo. El límite del plan se cuenta por usuario.

## Estilo de habla

Ajusta la salida sin cambiar de voz:

* **Velocidad de habla**: de algo más lenta a más rápida que la neutral.
* **Volumen de salida**: ajuste de nivel para voces bajas o altas.
* **Diccionario de pronunciación**: mapeo de clave-valor por asistente, por ejemplo `"API" → "A P I"` o el nombre de tu empresa deletreado fonéticamente. Se aplica a toda la salida hablada.
* **Filtros de markdown y emojis**: activados por defecto para que los artefactos de formato del LLM nunca se lean en voz alta.

## Cadenas de respaldo (Fallbacks & Guardrails)

Para mayor fiabilidad en producción puedes definir una **cadena de respaldo por etapa**: si el proveedor principal falla a mitad de la llamada, el motor cambia a la siguiente entrada y la llamada continúa sin interrupciones.

* **STT** — por ejemplo `Deepgram nova-3 → AssemblyAI universal-streaming`
* **LLM** — por ejemplo `GPT → Groq`
* **TTS** — por ejemplo `Cartesia sonic → ElevenLabs` (cada entrada puede especificar su propia voz)

Los cambios de estado del proveedor se registran como eventos de la llamada, así que después puedes ver si se activó algún respaldo. Los respaldos son una función limitada por plan.

<Note>
  Incluso sin respaldos configurados, una configuración rota nunca corta una llamada: el motor recurre a una pila predeterminada segura y registra un evento `config_error`.
</Note>
