> ## Documentation Index
> Fetch the complete documentation index at: https://docs.ouraicalling.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelle & Stimmen

> Der Modellkatalog, die Stimmenbibliothek mit Vorschau-Funktion und Fallback-Ketten

## Der Modellkatalog

Assistenten legen sich nicht auf feste Anbieter fest – sie wählen aus einem **kuratierten Modellkatalog**, der vier Typen abdeckt:

| Typ            | Anbieter (Beispiele)                        |
| -------------- | ------------------------------------------- |
| LLM            | OpenAI, Anthropic, Google, Groq, Azure      |
| Speech-to-Text | Deepgram, OpenAI, Google, Azure             |
| Text-to-Speech | Cartesia, ElevenLabs, OpenAI, Google, Azure |
| Realtime       | OpenAI (gpt-realtime), Google (Gemini Live) |

Nur der **Plattform-Admin** steuert die Verfügbarkeit. Er schaltet Modelle
global frei, kann sie für einzelne Nutzer erlauben oder sperren und legt die
kompatiblen Engine-Modi fest. Workspace-Admins können den Katalog nicht
überschreiben.

Mit dem Add-on Fallbacks & Guardrails zeigt der Assistenten-Editor Anbieter- und Modell-Auswahlfelder.
Pipeline, Realtime und Half-Cascade speichern getrennte Auswahlen. Bei
„Standard verwenden“ bleibt der Wert `null`, damit spätere Admin-Änderungen
automatisch greifen:

1. Auswahl am Assistenten (nur mit Fallbacks & Guardrails)
2. Persönlicher Standard des Plattform-Admins
3. Plattform-Standard
4. Sicherer Runtime-Fallback

Ohne Fallbacks & Guardrails bleibt der Editor automatisch wie bisher. Persönliche Admin-Standards
gelten trotzdem. Nicht mehr verfügbare Altwerte bleiben zum Zurücksetzen
sichtbar, können aber nicht erneut gewählt werden.

<Tip>
  Achte auf das Badge **Empfohlen** – das sind die Modelle, die wir am gründlichsten testen und auf die wir unsere Standardeinstellungen abstimmen. **Niedrige Latenz** kennzeichnet Modelle, die sich für flüssige Telefongespräche eignen.
</Tip>

## Die Stimmenbibliothek

Der Stimmen-Picker lädt den vollständigen, paginierten Katalog aller aktivierten TTS-Anbieter, filterbar nach Sprache und Geschlecht – **inklusive Audio-Vorschau**: Klick auf Play, und du hörst ein Sample, bevor du dich festlegst.

ElevenLabs-Stimmen mit individuellen Tarifen oder Credit-Multiplikatoren tauchen im Picker nicht auf – jede dort angezeigte ElevenLabs-Stimme läuft also zum Standardtarif des Anbieters.

* **Stimme pro Assistent** – die Standard-Sprechstimme.
* **Stimmen-Override pro Flow-Agent** – einzelne [Flow](/flow-builder/nodes)-Agenten können mit einer anderen Stimme sprechen (z. B. eine eigene Stimme für den Agenten „Vertriebsspezialist“).
* **Stimme pro Sprache** – bei [automatischer Sprachumschaltung](/assistants/languages) ordnest du jeder Sprache eine Stimme zu, sodass der Assistent Stimme und Sprache gemeinsam wechselt.
* **Geklonte Stimmen** – mit dem Add-on **Clone your own voice** (oder Include free im Plan) kannst du eigene Klone hinzufügen und sie wie jede andere Stimme aus der Bibliothek nutzen. Ein Klon gehört exklusiv dem Account, der ihn erstellt hat: Andere Mitglieder desselben Workspace können ihn weder sehen noch auswählen. Die Kapazität steuert `max_cloned_voices`.

## Sprechstil

Pipeline- und Half-Cascade-Assistenten verwenden dieselben anbieterabhängigen Voice-Einstellungen. Der Editor sendet nur Werte, die vom tatsächlich aufgelösten TTS-Modell unterstützt werden:

* **Cartesia Sonic 3 / 3.5** – Sprechgeschwindigkeit, Ausgabelautstärke und optionale dynamische Emotionshinweise.
* **Eleven v3** – Stability und native Audio-Tag-Ausdrucksstärke. Nicht unterstützte Werte für Geschwindigkeit, Similarity, Style und Speaker Boost werden nicht gesendet.
* **Andere unterstützte ElevenLabs-Modelle** – Sprechgeschwindigkeit, Stability, Similarity, Style Exaggeration und Speaker Boost.
* **OpenAI- und Gemini-TTS** – freie Sprechstil-Anweisungen, wenn das gewählte Modell sie unterstützt.
* **Aussprachewörterbuch** – Key-Value-Zuordnung pro Assistent, z. B. `"API" → "A P I"` oder dein Firmenname in phonetischer Schreibweise. Gilt für die komplette gesprochene Ausgabe.
* **Markdown- & Emoji-Filter** – standardmäßig aktiv, damit Formatierungsreste des LLMs nie vorgelesen werden.

Jede wirksame Voice-Einstellung ist Teil des Phrase-Cache-Keys. Dadurch können Begrüßungen und Füllsätze kein Audio mit veralteten Einstellungen wiederverwenden.

## Fallback-Ketten (Fallbacks & Guardrails)

Für den Produktivbetrieb legst du pro Stufe eine **Fallback-Kette** fest: Lässt die Qualität des primären Anbieters mitten im Anruf nach, springt die Engine zum nächsten Eintrag – der Anruf läuft nahtlos weiter.

* **STT** – z. B. `Deepgram nova-3 → AssemblyAI universal-streaming`
* **LLM** – z. B. `GPT → Groq`
* **TTS** – z. B. `Cartesia sonic → ElevenLabs` (jeder Eintrag kann seine eigene Stimme festlegen)

Statusänderungen bei den Anbietern werden als Anrufereignisse protokolliert, sodass du im Nachhinein nachvollziehen kannst, ob ein Fallback ausgelöst wurde. Fallbacks sind ein plangebundenes Feature.

<Note>
  Auch ohne konfigurierte Fallbacks bricht eine kaputte Konfiguration niemals einen Anruf ab: Die Engine greift auf einen sicheren Standard-Stack zurück und protokolliert ein `config_error`-Event.
</Note>
