Pipeline (Standard)
Klassische dreistufige Architektur: Speech-to-Text → LLM → Text-to-Speech. Jede Stufe ist ein separat auswählbares Modell aus dem Modellkatalog.- Volle Kontrolle: Wähle STT, LLM und TTS unabhängig voneinander, inklusive Fallback-Ketten pro Stufe.
- Größte Modell- und Stimmenauswahl, beste mehrsprachige Abdeckung.
- Turn-Erkennung über ein semantisches Turn-Modell oder Sprachaktivitätserkennung (konfigurierbar).
Echtzeit
Ein einzelnes Speech-to-Speech-Modell (z. B. OpenAIgpt-realtime, Google Gemini Live) hört zu und spricht direkt – ohne separates STT oder TTS.
- Geringste Latenz und sehr natürliche Prosodie (Lachen, Zögern, Tonfall).
- Die Stimmenauswahl kommt aus dem Echtzeitmodell selbst (z. B.
marin,cedarbei OpenAI;Puck,Korebei Gemini). - Die Turn-Erkennung kann robust, semantisch oder adaptiv arbeiten, wenn der gewählte Sprachmodus dies unterstützt. Andere Sprachmodi steuern das Timing automatisch.
- Weniger Stellschrauben: Stimmenbibliothek und Fallbacks pro Stufe entfallen.
Halbkaskade
Ein Hybrid: Ein Echtzeitmodell übernimmt das Zuhören und Denken (rein textbasiert), während eine separate TTS-Stimme spricht.- Verständnis und Turn-Taking auf Echtzeit-Niveau, kombiniert mit der von dir gewählten TTS-Stimme – auch geklonte oder Markenstimmen sind möglich.
- Die Ausgabestimme konfigurierst du genau wie im Pipeline-Modus (
TTS provider / model / voice).
Turn-Erkennung in Echtzeitmodi
Bei kompatiblen Echtzeit- und Halbkaskaden-Assistenten legst du fest, wie der Assistent erkennt, dass der Anrufer zu Ende gesprochen hat:- Robust (VAD) — reagiert nach einer klaren Pause. Schnell und vorhersehbar.
- Semantisch — wartet, bis der Anrufer seinen Gedanken offenbar beendet hat, auch bei einer Pause mitten im Satz. Die Reaktionsbereitschaft steuert, wie früh geantwortet wird.
- Adaptiv — kurze Bestätigungen wie „mhm“ oder „okay“ stoppen den Assistenten nicht, eine klare Unterbrechung lässt den Anrufer jedoch übernehmen. Zusätzlich lassen sich Mindeststille, Sprachempfindlichkeit und Unterbrechungsdauer einstellen oder Unterbrechungen ganz deaktivieren.
Zuverlässigkeitsverhalten
Wenn zum Zeitpunkt des Anrufs keine Echtzeit- oder Halbkaskade-Konfiguration aufgebaut werden kann (fehlender Anbieterschlüssel, nicht verfügbares Modell), schlägt der Anruf nicht fehl – die Engine wechselt automatisch zum Pipeline-Stack und hält das Ereignis im Anrufverlauf fest. Ein Konfigurationsproblem lässt einen laufenden Anruf nie abbrechen.