> ## Documentation Index
> Fetch the complete documentation index at: https://docs.ouraicalling.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Engine-Modi

> Pipeline, Echtzeit und Halbkaskade – wie dein Assistent hört und spricht

Die Einstellung **Modus** legt die Audio-Architektur deines Assistenten fest. Alle drei Modi funktionieren gleichermaßen mit Prompts und Flows.

## Pipeline (Standard)

Klassische dreistufige Architektur: **Speech-to-Text → LLM → Text-to-Speech**. Jede Stufe ist ein separat auswählbares Modell aus dem [Modellkatalog](/assistants/models-and-voices).

* Volle Kontrolle: Wähle STT, LLM und TTS unabhängig voneinander, inklusive Fallback-Ketten pro Stufe.
* Größte Modell- und Stimmenauswahl, beste mehrsprachige Abdeckung.
* Turn-Erkennung über ein semantisches Turn-Modell oder Sprachaktivitätserkennung (konfigurierbar).

**Nutze ihn, wenn** dir maximale Kontrolle über Qualität, Kosten und Sprachverhalten wichtig ist. Das ist die richtige Standardeinstellung für Telefonie im Produktivbetrieb.

## Echtzeit

Ein einzelnes **Speech-to-Speech**-Modell (z. B. OpenAI `gpt-realtime`, Google Gemini Live) hört zu und spricht direkt – ohne separates STT oder TTS.

* Geringste Latenz und sehr natürliche Prosodie (Lachen, Zögern, Tonfall).
* Die Stimmenauswahl kommt aus dem Echtzeitmodell selbst (z. B. `marin`, `cedar` bei OpenAI; `Puck`, `Kore` bei Gemini).
* Die Turn-Erkennung kann robust, semantisch oder adaptiv arbeiten, wenn der gewählte Sprachmodus dies unterstützt. Andere Sprachmodi steuern das Timing automatisch.
* Weniger Stellschrauben: Stimmenbibliothek und Fallbacks pro Stufe entfallen.

**Nutze ihn, wenn** dir das Gesprächsgefühl wichtiger ist als feingranulare Kontrolle – etwa bei Demos, Concierge-Erlebnissen oder Voice-First-Produkten.

## Halbkaskade

Ein Hybrid: Ein Echtzeitmodell übernimmt das **Zuhören und Denken** (rein textbasiert), während eine separate **TTS-Stimme** spricht.

* Verständnis und Turn-Taking auf Echtzeit-Niveau, kombiniert mit der von dir gewählten TTS-Stimme – auch geklonte oder Markenstimmen sind möglich.
* Die Ausgabestimme konfigurierst du genau wie im Pipeline-Modus (`TTS provider / model / voice`).

**Nutze ihn, wenn** du die Reaktionsfähigkeit von Echtzeit willst, aber eine bestimmte Stimme brauchst, die das Echtzeitmodell nicht anbietet.

## Turn-Erkennung in Echtzeitmodi

Bei kompatiblen Echtzeit- und Halbkaskaden-Assistenten legst du fest, wie der Assistent erkennt, dass der Anrufer zu Ende gesprochen hat:

* **Robust (VAD)** — reagiert nach einer klaren Pause. Schnell und vorhersehbar.
* **Semantisch** — wartet, bis der Anrufer seinen Gedanken offenbar beendet hat, auch bei einer Pause mitten im Satz. Die **Reaktionsbereitschaft** steuert, wie früh geantwortet wird.
* **Adaptiv** — kurze Bestätigungen wie „mhm“ oder „okay“ stoppen den Assistenten nicht, eine klare Unterbrechung lässt den Anrufer jedoch übernehmen. Zusätzlich lassen sich Mindeststille, Sprachempfindlichkeit und Unterbrechungsdauer einstellen oder Unterbrechungen ganz deaktivieren.

Assistenten ohne diese Auswahl steuern das Timing weiterhin automatisch. Bestehende Assistenten bleiben auf **Robust (VAD)**, bis du einen anderen Modus auswählst.

## Zuverlässigkeitsverhalten

<Note>
  Wenn zum Zeitpunkt des Anrufs keine Echtzeit- oder Halbkaskade-Konfiguration aufgebaut werden kann (fehlender Anbieterschlüssel, nicht verfügbares Modell), **schlägt der Anruf nicht fehl** – die Engine wechselt automatisch zum Pipeline-Stack und hält das Ereignis im Anrufverlauf fest. Ein Konfigurationsproblem lässt einen laufenden Anruf nie abbrechen.
</Note>

## Kurzvergleich

|                           | Pipeline                        | Echtzeit                      | Halbkaskade                     |
| ------------------------- | ------------------------------- | ----------------------------- | ------------------------------- |
| Latenz                    | Niedrig                         | Am niedrigsten                | Niedrig                         |
| Stimmenauswahl            | Vollständige Bibliothek + Klone | Modellnative Stimmen          | Vollständige Bibliothek + Klone |
| Fallbacks pro Stufe       | Ja                              | —                             | Nur auf TTS-Seite               |
| Mehrsprachiges Umschalten | Ja                              | Modellabhängig                | Ja (Ausgabe)                    |
| Am besten für             | Telefonie im Produktivbetrieb   | Natürlich wirkende Erlebnisse | Echtzeitgefühl + Markenstimme   |
