Skip to main content
Le paramètre mode contrôle l’architecture audio de l’assistant. Les trois modes fonctionnent de la même manière avec des invites et des flux.

Pipeline (par défaut)

Architecture classique en trois étapes : parole en texte → LLM → synthèse vocale. Chaque étape est un modèle sélectionnable séparément dans le catalogue de modèles.
  • Contrôle total : choisissez indépendamment STT, LLM et TTS, y compris les chaînes de secours par étape.
  • Sélection de modèles et de voix la plus large, meilleure couverture multilingue.
  • Détection de virage via un modèle de virage sémantique ou détection d’activité vocale (configurable).
Utilisez-le lorsque vous souhaitez un contrôle maximal sur la qualité, les coûts et le comportement linguistique. C’est la bonne valeur par défaut pour la téléphonie de production.

Temps réel

Un seul modèle parole-parole (par exemple OpenAI gpt-realtime, Google Gemini Live) écoute et parle directement, sans STT ou TTS distincts.
  • Latence la plus faible et prosodie très naturelle (rire, hésitation, ton).
  • La sélection vocale provient du modèle temps réel (par exemple marin, cedar pour OpenAI ; Puck, Kore pour Gemini).
  • La détection de virage s’effectue côté serveur dans le modèle.
  • Moins de boutons : la bibliothèque vocale, les solutions de repli par étape et certains réglages d’interruption ne s’appliquent pas.
Utilisez-le lorsque l’ambiance conversationnelle compte plus qu’un contrôle précis : démos, expériences de conciergerie, produits axés sur la voix.

Demi-cascade

Un hybride : un modèle en temps réel se charge de l’écoute et de la réflexion (texte uniquement), tandis qu’une voix TTS distincte se charge de parler.
  • Compréhension en temps réel et prise de tour de rôle, combinées à la voix TTS de votre choix, y compris les voix clonées ou de marque.
  • La voix de sortie est configurée exactement comme en mode pipeline (TTS provider / model / voice).
Utilisez-le lorsque vous souhaitez une réactivité en temps réel mais avez besoin d’une voix spécifique que le modèle en temps réel n’offre pas.

Comportement de fiabilité

Si une configuration en temps réel ou en demi-cascade ne peut pas être créée au moment de l’appel (clé de fournisseur manquante, modèle indisponible), l’appel n’échoue pas : le moteur revient automatiquement à la pile de pipeline et enregistre l’événement dans le journal des appels. Un problème de configuration n’interrompt jamais un appel en direct.

Comparaison rapide