Skip to main content

Primärsprache festlegen

Jeder Assistent hat eine STT-Sprache, die dem Transkriptionsmodell sagt, was es erwarten kann. Stelle sie auf die Sprache ein, die deine Anrufer tatsächlich sprechen – das verbessert messbar die Erkennung von Namen, Nummern und Adressen. Für die Ausgabesprache des Assistenten legst du die Regel explizit im System-Prompt fest:
Die Turn Detection unterstützt ein mehrsprachiges semantisches Modell (Standard), das Satzgrenzen sprachübergreifend erkennt, außerdem eine für Englisch optimierte Variante sowie einfaches VAD.

Mehrsprachige Assistenten

Für Märkte, in denen Anrufer zwischen Sprachen wechseln (im DACH-Raum üblich: Deutsch, Türkisch, Englisch), richte die automatische Sprachumschaltung ein:
  1. Wähle ein mehrsprachiges STT-Modell (z. B. Deepgram nova-3 multilingual), damit die Transkription dem Anrufer folgt.
  2. Füge mindestens eine Zweitsprache hinzu. Die automatische Umschaltung aktiviert sich, sobald eine Zweitsprache vorhanden ist, und deaktiviert sich wieder, wenn die letzte entfernt wird.
  3. Ordne optional eine Stimme pro Sprache zu – zum Beispiel eine deutsche Stimme für de, eine englische Stimme für en. Wechselt der Anrufer die Sprache, antwortet der Assistent in der neuen Sprache mit der passenden Stimme.
Der Assistent bekommt außerdem einen Prompt-Hinweis, in der erkannten Sprache zu antworten – so folgt das LLM automatisch, ohne dass du zusätzliches Prompt-Engineering brauchst. Sprachspezifische Stimm-Überschreibungen gibt es für die Pipeline- und Half-Cascade-Engines, weil diese Modi eine eigene TTS-Komponente haben. Bei einer reinen Realtime-Speech-to-Speech-Engine sind sie ausgeblendet. Die aktuellen Integrationen von Cartesia, ElevenLabs, OpenAI, Google und Azure TTS unterstützen Live-Stimmaktualisierungen; der Worker übersetzt jede Überschreibung in die native Option des jeweiligen Anbieters. Half-Cascade nutzt das Realtime-Modell für das Sprachverständnis, aber Transkripte der Anbieter können verspätet und ohne erkannte Sprache eintreffen. Sind Zweitsprachen konfiguriert, ergänzt die Plattform deshalb automatisch einen separaten mehrsprachigen Transkriptionsstream. Der liefert zuverlässige Sprachmetadaten, ohne die Turn-Verarbeitung des Realtime-Modells zu verändern.
Wenn du die Editor-Ansicht auf Stimme pro Sprache umstellst, wird dadurch allein noch keine Einstellung gespeichert. Ein language_voices-Eintrag entsteht erst, wenn du für eine Sprache eine Stimme auswählst. Sprachen ohne Eintrag behalten die Hauptstimme des Assistenten.
Halte den System-Prompt in einer Sprache (idealerweise Englisch – LLMs folgen englischen Anweisungen am zuverlässigsten) und formuliere die Antwortregel explizit: „Antworte in der Sprache, die der Anrufer spricht.“

API

Die Spracheinrichtung lässt sich vollständig per Skript steuern: primary_language, secondary_languages[], auto_language_switch und die sprachspezifische Stimmzuordnung language_voices sind ganz normale Assistenten-Felder – setze sie über PATCH /api/v1/assistants/{id} oder das MCP-Tool update_assistant. Im Dashboard wird auto_language_switch automatisch daraus abgeleitet, ob secondary_languages befüllt ist. Die unterstützten Sprachcodes (ISO 639-1) findest du über GET /api/v1/languages.

Aussprache über mehrere Sprachen hinweg

Das Aussprachewörterbuch gilt sprachübergreifend – nützlich bei Markennamen, die TTS-Stimmen je nach Sprache unterschiedlich falsch aussprechen. Tenant-Admins können eine tenant-weite Standardzuordnung definieren, die mit den Einträgen einzelner Assistenten zusammengeführt wird.

Sprache der Post-Call-Zusammenfassung

Die Conversation Summary im Anruf-Detail wird immer in der Hauptsprache des Assistenten geschrieben – nicht in der Sprache, in der das Gespräch geführt wurde. Ein deutscher Assistent, der einen englischen Anruf annimmt, erhält also weiterhin eine deutsche Zusammenfassung, sodass die History-Liste in einer Sprache lesbar bleibt. Beim erneuten Auswerten (History → Re-evaluate) gilt dieselbe Regel. Alles andere bleibt in der Originalsprache: Transkript, Aufzeichnungen und extrahierte Analysefelder werden nie übersetzt.
Wird primary_language geändert, folgen nur neue Zusammenfassungen der neuen Sprache – bereits gespeicherte Zusammenfassungen alter Anrufe werden nicht neu geschrieben. Über Re-evaluate an einem Anruf lässt sich die Zusammenfassung in der neuen Sprache neu erzeugen.

Dokumentation vs. Anrufsprache

Beachte: Die Sprache der Plattform-Oberfläche und die Anrufsprache des Assistenten sind unabhängig voneinander – dein Team kann ein englisches Dashboard nutzen, während die Assistenten auf Deutsch mit Kunden sprechen, und umgekehrt.