01 Fonctionnalité

Des agents vocaux IA, en speech-to-speech ou en pipeline.

CallShift fait tourner des agents téléphoniques IA sur des modèles speech-to-speech natifs (Gemini Live, GPT-Live et Realtime d'OpenAI, Grok Voice) et sur des pipelines STT → LLM → TTS, et choisit l'architecture cas d'usage par cas d'usage. Les deux architectures tournent en production depuis 2024 et ont été comparées en test A/B sur une campagne réelle.

01 Définition

Qu'est-ce qu'un agent vocal speech-to-speech ?

Un agent vocal speech-to-speech est un agent téléphonique IA construit sur un seul modèle, qui entend l'audio et répond en audio, sans transcription ni voix distincte entre les deux. Un agent vocal en pipeline enchaîne au contraire trois modèles : la reconnaissance vocale (STT), un grand modèle de langage (LLM) et la synthèse vocale (TTS).

La différence tient à ce que l'appelant entend et à ce que vous contrôlez. Le speech-to-speech conserve le ton, les hésitations et les interruptions, et répond en un seul saut. Un pipeline transforme chaque tour de parole en texte que l'on peut inspecter, contraindre et rejouer, au prix de sauts supplémentaires et d'un échange qui se fait tour par tour.

  • ~0,8 stemps de réponse typique en speech-to-speech, p95 1,4 s
  • ~1,4 stemps de réponse typique en pipeline, p95 2,6 s
  • ~20 %de performance en plus pour le speech-to-speech dans le test A/B d'uMinds en production

Mis à jour le 29 septembre 2026

02 Architecture

Pipeline orchestré ou speech-to-speech ? Le choix se fait use case par use case.

Deux architectures de voice AI, deux promesses opposées. Le pipeline orchestré (STT → LLM → TTS) fait passer chaque tour de parole par du texte : c'est le déterminisme. Le speech-to-speech natif garde l'audio de bout en bout : c'est le naturel. Aucune des deux ne gagne partout, et c'est cet arbitrage, bien plus que le modèle, qui décide de la réussite d'un déploiement.

Un de nos savoir-faire

Pipeline orchestré · STT → LLM → TTS

Privilégiez le déterminisme.

Le texte intermédiaire est un point de contrôle : ce qui est transcrit s'inspecte, se contraint et se rejoue à l'identique.

  • Flux de tool-calling complexes, enchaînements conditionnels, formulaires longs
  • Scripts contraints où chaque mention doit être prononcée telle quelle
  • Chaque étage se choisit et se remplace séparément : STT, LLM, voix
  • Transcription native : audit, contrôle qualité et revue des appels, tout est traçable

Speech-to-speech natif · audio → audio

Privilégiez le naturel.

Une seule boucle audio native, sans couche de transcription : le modèle entend le ton et répond avec le sien.

  • Accueil, qualification, relance : partout où le naturel améliore la conversion
  • Faible latence, interruptions fluides, nuance émotionnelle entendue et rendue
  • Emails et numéros captés sans transcripteur intermédiaire pour les écorcher
  • Ton, accent et style pilotés depuis le prompt, à la volée
Temps de réponse, à partir du dernier mot de l'appelant
Pipeline4 sauts~1,4 s typique · p95 2,6 s

VAD 400 ms · STT 250 ms · LLM 350 ms · TTS 200 ms · sauts 200 ms

Speech-to-speech1 saut~0,8 s typique · p95 1,4 s

fin de parole 250 ms · premier audio 500 ms

Chiffres typiques issus de benchmarks publics et de mesures terrain, avec le 95e percentile indiqué ; chaque saut ajoute sa propre file d'attente.

Lors d'un test A/B mené en production, les agents speech-to-speech en espagnol d'uMinds ont fait environ 20 % de mieux que le pipeline Cartesia + GPT-4.1 mini + Deepgram qu'ils utilisaient auparavant. Voir le cas uMinds

“Grâce à de solides paris sur des modèles comme Gemini, ils ont apporté la qualité et les tarifs qui nous ont fait quitter d'autres fournisseurs.”

Francesco Haces MunozCofondateur, uMinds
Ouvrir le simulateur
03 Cas d'usage

Quelle architecture pour quel appel ?

Le choix se fait flux par flux, pas une fois pour toute l'entreprise. Ce que nous choisissons, et pourquoi.

Parcours d'appelArchitecturePourquoi
Accueil, standard, ligne hors horairesSpeech-to-speechRéponses rapides, interruptions bien gérées, voix naturelle : les appelants restent en ligne.
Qualification de leads, relances, campagnes sortantesSpeech-to-speechPartout où le naturel améliore la conversion : environ 20 % de mieux que le pipeline dans le test A/B d'uMinds.
Capture d'emails, de numéros de téléphone, de codesSpeech-to-speechAucun transcripteur intermédiaire pour les écorcher.
Formulaires longs, enchaînements conditionnels, nombreux outilsPipelineUtilisation déterministe des outils et sorties structurées, avec n'importe quel LLM.
Scripts réglementés à prononcer tels quelsPipelineLe texte intermédiaire est un point de contrôle : chaque mention est vérifiée avant d'être prononcée.
Raisonnement complexe avec une voix naturelleSpeech-to-speech + LLMUne couche vocale full-duplex tient la conversation pendant qu'un modèle texte réfléchit et appelle les outils.
Appels longs, prompts lourds, facture prévisiblePipeline ou speech-to-speech à tarif fixeLes modèles audio natifs qui refacturent tout le contexte à chaque tour coûtent plus cher à mesure que l'appel s'allonge.
Données conservées dans l'UEPipeline, ou Gemini Live et OpenAI sur des endpoints UERésidence des données composant par composant ; Grok Voice n'a pas encore d'option UE publiée.
04 Modèles

Les modèles que nous faisons tourner en production.

Chaque modèle de notre simulateur d'architecture tourne en production chez CallShift. Scores au 15 septembre 2026.

ModèleTypeSpeech to Speech IndexRéponse typiqueIdéal pour
Gemini 3.1 Flash LiveSpeech-to-speech71.5~0,8 sAppels courts avec un prompt compact, là où le rendu compte le plus
Gemini 3.8 LiveSpeech-to-speech76.0~0,8 sAppels courts avec un prompt compact : le rendu natif le moins cher
GPT-Realtime-2.1-miniSpeech-to-speechnon évalué~0,9 sFlux simples où un seul fournisseur et un rendu natif priment sur le contrôle fin
Grok Voice 2.0Speech-to-speech82.9~0,7 sAppels longs ou prompts lourds à prix fixe et prévisible ; la réponse la plus rapide du comparatif
GPT-Live-1 + backendSpeech-to-speech + LLM81.5~0,9 sTâches complexes qui demandent du raisonnement, avec une facture prévisible

Composants du pipeline

Speech-to-text
Deepgram Nova-3 · AssemblyAI Universal-Streaming · ElevenLabs Scribe v2 Realtime · OpenAI gpt-4o-mini-transcribe · Gradium STT
LLM
GPT-5.6 Luna · GPT-4.1 mini · Gemini 3.8 Flash · Gemini 3.1 Flash-Lite · GPT-5.6 Terra
Text-to-speech
Cartesia Sonic · Inworld TTS 1.5 · Deepgram Aura-2 · ElevenLabs Flash v2.5 · OpenAI gpt-4o-mini-tts · Gradium TTS

Speech to Speech Index par Artificial Analysis. Temps de réponse typique entre le dernier mot de l'appelant et le premier audio de l'agent, d'après des benchmarks publics et des mesures terrain.

Tester votre prompt
05 Questions

Voice AI speech-to-speech : vos questions, nos réponses.

Le speech-to-speech est-il prêt pour des appels téléphoniques en production ?

Oui. uMinds fait tourner des appels de vente en espagnol sur Gemini 3.1 Flash Live via CallShift : 50 000 appels passés en moins de 3 heures sur leur propre SIP, après un test A/B en production qui a donné au speech-to-speech environ 20 % d'avance sur leur pipeline Deepgram + GPT-4.1 mini + Cartesia. Lire le cas uMinds.

À quelle vitesse répond un agent vocal speech-to-speech ?

En général en 0,8 s environ après le dernier mot de l'appelant, 1,4 s au 95e percentile, contre environ 1,4 s et 2,6 s pour un pipeline. Un seul modèle, c'est un seul saut réseau ; un pipeline enchaîne détection d'activité vocale, STT, LLM et TTS, et chaque saut ajoute sa propre file d'attente.

Un agent speech-to-speech peut-il appeler des outils et suivre un script ?

Il appelle des outils (votre CRM, votre agenda, vos API) en cours d'appel. Il n'est pas déterministe pour autant : il se comporte comme avec une température fixée à 1, et ses sorties structurées sont limitées. Pour les scripts à dire mot pour mot ou les formulaires longs, nous utilisons un pipeline, ou une couche vocale speech-to-speech qui délègue le raisonnement et les outils à un modèle texte.

Comment auditer un appel sans la transcription d'un pipeline ?

Chaque appel est enregistré, transcrit et résumé a posteriori, puis étiqueté et évalué selon les critères de réussite que vous définissez, avec une alerte après chaque appel. La revue est la même quelle que soit l'architecture.

Quel modèle speech-to-speech sonne le mieux en français, en espagnol ou en néerlandais ?

Gemini 3.1 Flash Live offre la meilleure voix et le meilleur rendu du marché dans toutes les langues que nous exploitons, français, espagnol et néerlandais compris. En espagnol, Gemini 3.8 Live suit de près ; en français et en néerlandais, les voix d'OpenAI et de xAI sont en retrait.

Le speech-to-speech coûte-t-il plus cher qu'un pipeline ?

Cela dépend de l'appel. Gemini Live refacture le prompt, les outils et tout l'audio échangé jusque-là à chaque tour, et convient donc aux appels courts avec un prompt compact ; Grok Voice facture un tarif fixe de 0,08 $ la minute ; sur les appels longs avec des prompts lourds, un pipeline revient souvent moins cher. Comparez les trois sur votre propre prompt dans le simulateur d'architecture.

Vous avez encore des questions ?

Contactez-nous

Contact

Autres fonctionnalités

Call Builder, API, webhooks et skill Claude

Dessinez le parcours d'appel de votre agent dans le Call Builder no-code, puis pilotez CallShift depuis votre stack ou depuis Claude : une API REST, des outils que vos agents utilisent en cours d'appel, un webhook de fin d'appel et une skill Claude.

Prochaine étape

Voyez ce que ça donne sur vos propres appels.

Réservez un appel avec un ingénieur voice AI : nous partons de vos parcours d'appel réels et vous montrons l'agent, l'architecture et les chiffres qui leur correspondent.

1:1avec un ingénieur voice AI, sans slides
2architectures que nous mettons en production : speech-to-speech et pipelines
1plan de déploiement avec lequel vous repartez : volume, tarifs, téléphonie

~0 % d'appels manqués chez Bonnie&Car, contre 55 % avant. Lire l'étude de cas