> ## Documentation Index
> Fetch the complete documentation index at: https://docs.ouraicalling.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Modes moteur

> Pipeline, temps réel et demi-cascade : comment votre assistant entend et parle

Le paramètre **mode** contrôle l'architecture audio de l'assistant. Les trois modes fonctionnent de la même manière avec des invites et des flux.

## Pipeline (par défaut)

Architecture classique en trois étapes : **parole en texte → LLM → synthèse vocale**. Chaque étape est un modèle sélectionnable séparément dans le [catalogue de modèles](/assistants/models-and-voices).

* Contrôle total : choisissez indépendamment STT, LLM et TTS, y compris les chaînes de secours par étape.
* Sélection de modèles et de voix la plus large, meilleure couverture multilingue.
* Détection de virage via un modèle de virage sémantique ou détection d'activité vocale (configurable).

**Utilisez-le lorsque** vous souhaitez un contrôle maximal sur la qualité, les coûts et le comportement linguistique. C'est la bonne valeur par défaut pour la téléphonie de production.

## Temps réel

Un seul modèle **parole-parole** (par exemple OpenAI `gpt-realtime`, Google Gemini Live) écoute et parle directement, sans STT ou TTS distincts.

* Latence la plus faible et prosodie très naturelle (rire, hésitation, ton).
* La sélection vocale provient du modèle temps réel (par exemple `marin`, `cedar` pour OpenAI ; `Puck`, `Kore` pour Gemini).
* La détection de virage s'effectue côté serveur dans le modèle.
* Moins de boutons : la bibliothèque vocale, les solutions de repli par étape et certains réglages d'interruption ne s'appliquent pas.

**Utilisez-le lorsque** l'ambiance conversationnelle compte plus qu'un contrôle précis : démos, expériences de conciergerie, produits axés sur la voix.

## Demi-cascade

Un hybride : un modèle en temps réel se charge de **l'écoute et de la réflexion** (texte uniquement), tandis qu'une **voix TTS** distincte se charge de parler.

* Compréhension en temps réel et prise de tour de rôle, combinées à la voix TTS de votre choix, y compris les voix clonées ou de marque.
* La voix de sortie est configurée exactement comme en mode pipeline (`TTS provider / model / voice`).

**Utilisez-le lorsque** vous souhaitez une réactivité en temps réel mais avez besoin d'une voix spécifique que le modèle en temps réel n'offre pas.

## Comportement de fiabilité

<Note>
  Si une configuration en temps réel ou en demi-cascade ne peut pas être créée au moment de l'appel (clé de fournisseur manquante, modèle indisponible), l'appel **n'échoue pas** : le moteur revient automatiquement à la pile de pipeline et enregistre l'événement dans le journal des appels. Un problème de configuration n’interrompt jamais un appel en direct.
</Note>

## Comparaison rapide

|                                | Pipeline                       | Temps réel                 | Demi-cascade                                |
| ------------------------------ | ------------------------------ | -------------------------- | ------------------------------------------- |
| Latence                        | Faible                         | Le plus bas                | Faible                                      |
| Sélection de voix              | Bibliothèque complète + clones | Voix natives du modèle     | Bibliothèque complète + clones              |
| Solutions de secours par étape | Oui                            | —                          | Côté TTS uniquement                         |
| Commutation multilingue        | Oui                            | Dépend du modèle           | Oui (sortie)                                |
| Idéal pour                     | Téléphonie de production       | Des expériences naturelles | Sensation en temps réel + voix de la marque |
