Der Modellkatalog
Assistenten legen sich nicht auf feste Anbieter fest – sie wählen aus einem kuratierten Modellkatalog, der vier Typen abdeckt:
Nur der Plattform-Admin steuert die Verfügbarkeit. Er schaltet Modelle
global frei, kann sie für einzelne Nutzer erlauben oder sperren und legt die
kompatiblen Engine-Modi fest. Workspace-Admins können den Katalog nicht
überschreiben.
Mit dem Add-on Fallbacks & Guardrails zeigt der Assistenten-Editor Anbieter- und Modell-Auswahlfelder.
Pipeline, Realtime und Half-Cascade speichern getrennte Auswahlen. Bei
„Standard verwenden“ bleibt der Wert
null, damit spätere Admin-Änderungen
automatisch greifen:
- Auswahl am Assistenten (nur mit Fallbacks & Guardrails)
- Persönlicher Standard des Plattform-Admins
- Plattform-Standard
- Sicherer Runtime-Fallback
Die Stimmenbibliothek
Der Stimmen-Picker lädt den vollständigen, paginierten Katalog aller aktivierten TTS-Anbieter, filterbar nach Sprache und Geschlecht – inklusive Audio-Vorschau: Klick auf Play, und du hörst ein Sample, bevor du dich festlegst. ElevenLabs-Stimmen mit individuellen Tarifen oder Credit-Multiplikatoren tauchen im Picker nicht auf – jede dort angezeigte ElevenLabs-Stimme läuft also zum Standardtarif des Anbieters.- Stimme pro Assistent – die Standard-Sprechstimme.
- Stimmen-Override pro Flow-Agent – einzelne Flow-Agenten können mit einer anderen Stimme sprechen (z. B. eine eigene Stimme für den Agenten „Vertriebsspezialist“).
- Stimme pro Sprache – bei automatischer Sprachumschaltung ordnest du jeder Sprache eine Stimme zu, sodass der Assistent Stimme und Sprache gemeinsam wechselt.
- Geklonte Stimmen – mit dem Add-on Clone your own voice (oder Include free im Plan) kannst du eigene Klone hinzufügen und sie wie jede andere Stimme aus der Bibliothek nutzen. Ein Klon gehört exklusiv dem Account, der ihn erstellt hat: Andere Mitglieder desselben Workspace können ihn weder sehen noch auswählen. Die Kapazität steuert
max_cloned_voices.
Sprechstil
Pipeline- und Half-Cascade-Assistenten verwenden dieselben anbieterabhängigen Voice-Einstellungen. Der Editor sendet nur Werte, die vom tatsächlich aufgelösten TTS-Modell unterstützt werden:- Cartesia Sonic 3 / 3.5 – Sprechgeschwindigkeit, Ausgabelautstärke und optionale dynamische Emotionshinweise.
- Eleven v3 – Stability und native Audio-Tag-Ausdrucksstärke. Nicht unterstützte Werte für Geschwindigkeit, Similarity, Style und Speaker Boost werden nicht gesendet.
- Andere unterstützte ElevenLabs-Modelle – Sprechgeschwindigkeit, Stability, Similarity, Style Exaggeration und Speaker Boost.
- OpenAI- und Gemini-TTS – freie Sprechstil-Anweisungen, wenn das gewählte Modell sie unterstützt.
- Aussprachewörterbuch – Key-Value-Zuordnung pro Assistent, z. B.
"API" → "A P I"oder dein Firmenname in phonetischer Schreibweise. Gilt für die komplette gesprochene Ausgabe. - Markdown- & Emoji-Filter – standardmäßig aktiv, damit Formatierungsreste des LLMs nie vorgelesen werden.
Fallback-Ketten (Fallbacks & Guardrails)
Für den Produktivbetrieb legst du pro Stufe eine Fallback-Kette fest: Lässt die Qualität des primären Anbieters mitten im Anruf nach, springt die Engine zum nächsten Eintrag – der Anruf läuft nahtlos weiter.- STT – z. B.
Deepgram nova-3 → AssemblyAI universal-streaming - LLM – z. B.
GPT → Groq - TTS – z. B.
Cartesia sonic → ElevenLabs(jeder Eintrag kann seine eigene Stimme festlegen)
Auch ohne konfigurierte Fallbacks bricht eine kaputte Konfiguration niemals einen Anruf ab: Die Engine greift auf einen sicheren Standard-Stack zurück und protokolliert ein
config_error-Event.