Skip to main content
Die Einstellung Modus legt die Audio-Architektur deines Assistenten fest. Alle drei Modi funktionieren gleichermaßen mit Prompts und Flows.

Pipeline (Standard)

Klassische dreistufige Architektur: Speech-to-Text → LLM → Text-to-Speech. Jede Stufe ist ein separat auswählbares Modell aus dem Modellkatalog.
  • Volle Kontrolle: Wähle STT, LLM und TTS unabhängig voneinander, inklusive Fallback-Ketten pro Stufe.
  • Größte Modell- und Stimmenauswahl, beste mehrsprachige Abdeckung.
  • Turn-Erkennung über ein semantisches Turn-Modell oder Sprachaktivitätserkennung (konfigurierbar).
Nutze ihn, wenn dir maximale Kontrolle über Qualität, Kosten und Sprachverhalten wichtig ist. Das ist die richtige Standardeinstellung für Telefonie im Produktivbetrieb.

Echtzeit

Ein einzelnes Speech-to-Speech-Modell (z. B. OpenAI gpt-realtime, Google Gemini Live) hört zu und spricht direkt – ohne separates STT oder TTS.
  • Geringste Latenz und sehr natürliche Prosodie (Lachen, Zögern, Tonfall).
  • Die Stimmenauswahl kommt aus dem Echtzeitmodell selbst (z. B. marin, cedar bei OpenAI; Puck, Kore bei Gemini).
  • Die Turn-Erkennung kann robust, semantisch oder adaptiv arbeiten, wenn der gewählte Sprachmodus dies unterstützt. Andere Sprachmodi steuern das Timing automatisch.
  • Weniger Stellschrauben: Stimmenbibliothek und Fallbacks pro Stufe entfallen.
Nutze ihn, wenn dir das Gesprächsgefühl wichtiger ist als feingranulare Kontrolle – etwa bei Demos, Concierge-Erlebnissen oder Voice-First-Produkten.

Halbkaskade

Ein Hybrid: Ein Echtzeitmodell übernimmt das Zuhören und Denken (rein textbasiert), während eine separate TTS-Stimme spricht.
  • Verständnis und Turn-Taking auf Echtzeit-Niveau, kombiniert mit der von dir gewählten TTS-Stimme – auch geklonte oder Markenstimmen sind möglich.
  • Die Ausgabestimme konfigurierst du genau wie im Pipeline-Modus (TTS provider / model / voice).
Nutze ihn, wenn du die Reaktionsfähigkeit von Echtzeit willst, aber eine bestimmte Stimme brauchst, die das Echtzeitmodell nicht anbietet.

Turn-Erkennung in Echtzeitmodi

Bei kompatiblen Echtzeit- und Halbkaskaden-Assistenten legst du fest, wie der Assistent erkennt, dass der Anrufer zu Ende gesprochen hat:
  • Robust (VAD) — reagiert nach einer klaren Pause. Schnell und vorhersehbar.
  • Semantisch — wartet, bis der Anrufer seinen Gedanken offenbar beendet hat, auch bei einer Pause mitten im Satz. Die Reaktionsbereitschaft steuert, wie früh geantwortet wird.
  • Adaptiv — kurze Bestätigungen wie „mhm“ oder „okay“ stoppen den Assistenten nicht, eine klare Unterbrechung lässt den Anrufer jedoch übernehmen. Zusätzlich lassen sich Mindeststille, Sprachempfindlichkeit und Unterbrechungsdauer einstellen oder Unterbrechungen ganz deaktivieren.
Assistenten ohne diese Auswahl steuern das Timing weiterhin automatisch. Bestehende Assistenten bleiben auf Robust (VAD), bis du einen anderen Modus auswählst.

Zuverlässigkeitsverhalten

Wenn zum Zeitpunkt des Anrufs keine Echtzeit- oder Halbkaskade-Konfiguration aufgebaut werden kann (fehlender Anbieterschlüssel, nicht verfügbares Modell), schlägt der Anruf nicht fehl – die Engine wechselt automatisch zum Pipeline-Stack und hält das Ereignis im Anrufverlauf fest. Ein Konfigurationsproblem lässt einen laufenden Anruf nie abbrechen.

Kurzvergleich