Pipeline (par défaut)
Architecture classique en trois étapes : parole en texte → LLM → synthèse vocale. Chaque étape est un modèle sélectionnable séparément dans le catalogue de modèles.- Contrôle total : choisissez indépendamment STT, LLM et TTS, y compris les chaînes de secours par étape.
- Sélection de modèles et de voix la plus large, meilleure couverture multilingue.
- Détection de virage via un modèle de virage sémantique ou détection d’activité vocale (configurable).
Temps réel
Un seul modèle parole-parole (par exemple OpenAIgpt-realtime, Google Gemini Live) écoute et parle directement, sans STT ou TTS distincts.
- Latence la plus faible et prosodie très naturelle (rire, hésitation, ton).
- La sélection vocale provient du modèle temps réel (par exemple
marin,cedarpour OpenAI ;Puck,Korepour Gemini). - La détection de virage s’effectue côté serveur dans le modèle.
- Moins de boutons : la bibliothèque vocale, les solutions de repli par étape et certains réglages d’interruption ne s’appliquent pas.
Demi-cascade
Un hybride : un modèle en temps réel se charge de l’écoute et de la réflexion (texte uniquement), tandis qu’une voix TTS distincte se charge de parler.- Compréhension en temps réel et prise de tour de rôle, combinées à la voix TTS de votre choix, y compris les voix clonées ou de marque.
- La voix de sortie est configurée exactement comme en mode pipeline (
TTS provider / model / voice).
Comportement de fiabilité
Si une configuration en temps réel ou en demi-cascade ne peut pas être créée au moment de l’appel (clé de fournisseur manquante, modèle indisponible), l’appel n’échoue pas : le moteur revient automatiquement à la pile de pipeline et enregistre l’événement dans le journal des appels. Un problème de configuration n’interrompt jamais un appel en direct.