Pipeline ou speech-to-speech ? Faites le calcul.
Trouvez la meilleure architecture voice AI pour votre cas d'usage. Collez votre prompt système, réglez la durée de vos appels et la langue de votre agent, puis comparez Gemini 3.8 Live, Gemini 3.1 Flash Live, GPT-Realtime-mini, Grok Voice 2.0 et GPT-Live-1 à un pipeline orchestré STT + LLM + TTS, aux tarifs publics.
- 6 architectures
- Tarification tour par tour
- Temps de réponse décomposés
- Rien ne quitte votre navigateur
Quatre réglages. Toute la page se met à jour au fil de votre saisie.
Collez votre prompt, réglez la durée de l'appel, indiquez qui appelle qui et dans quelle langue. Les prix sont les tarifs publics au 15 septembre 2026, coûts des modèles uniquement.
≈ 11 tours de dialogue à 5,3 tours par minute
Avancé▸Outils, profil de conversation, composants du pipeline, backend, résidence des données dans l'UE
Chaque outil ajoute environ 180 tokens de définition, renvoyés à chaque tour
Chacun ajoute un aller-retour avec le modèle. En auto : environ 1,5 par minute
Le speech-to-speech refacture le contexte à chaque tour
Le reste : silences et temps de réflexion
Détermine le coût du TTS et de la sortie audio
Facturé sur tout l'appel
Entrée / sortie pour 1 M de tokens ; le préfixe répété est facturé au tarif en cache (10 %)
Facturé sur les minutes de parole générée
Le modèle auquel GPT-Live-1 délègue le raisonnement et les outils
Gemini 3.1 Flash Live
+187 % par rapport à la moins chère (GPT-Realtime-2.1-mini), pour une conversation plus fluide et une réponse plus rapide (~0,8 s contre ~0,9 s) : un seul saut, sans passage de relais STT → LLM → TTS. Soit 0,061 $ de plus par appel. Ce surcoût vous offre la meilleure voix du comparatif : la famille de voix de Gemini 3.1 arrive en tête du benchmark Pronunciation Robustness d'Artificial Analysis (88,1 %), si bien que noms, montants, dates et emails sont prononcés correctement. Le meilleur rendu donne droit à +100 % de budget supplémentaire sur les appels entrants. Contrepartie : contrôle 3,5/5. Le speech-to-speech se comporte comme avec une température fixée à 1 ; gardez le pipeline pour une utilisation déterministe des outils.
Écart de prix avec l'option au meilleur rapport qualité-prix ; survolez la moins chère pour savoir pourquoi elle l'emporte sur le prix.
Gratuit, 15 min. Venez avec votre prompt, repartez avec votre architecture.
Créer un comptePourquoi le speech-to-speech paraît plus rapide.
Du dernier mot de l'appelant au premier mot de l'agent. Un pipeline enchaîne quatre fournisseurs, soit autant de sauts réseau avec chacun sa file d'attente : les délais s'additionnent, et le saut le plus lent du moment dicte les pics de latence. Le speech-to-speech, c'est un seul modèle, un seul saut.
Fin de parole, détectée par le modèle 200 msPremier audio 500 ms
Fin de parole, détectée par le modèle 250 msPremier audio 500 ms
Fin de parole, détectée par le modèle 250 msPremier audio 500 ms
Fin de parole, détectée par le modèle 300 msPremier audio 600 ms
Full duplex, sans détection explicite de fin de tour 200 msPremier audio (le backend réfléchit en parallèle) 700 ms
VAD : attente du silence + détection de fin de parole 400 msTranscription finale du STT 250 msPremier token du LLM 350 msPremier audio du TTS 200 msLatence des sauts (réseau, files d'attente) 200 ms
Chiffres typiques issus de benchmarks publics et de mesures terrain, et non des chiffres annoncés par les fournisseurs. La somme des latences annoncées par les fournisseurs n'est qu'un plancher : la détection de fin de tour doit attendre le silence, la transcription doit être finalisée avant que le LLM démarre, le premier token doit arriver avant que le TTS puisse parler, et chaque saut ajoute du temps de sérialisation, de réseau et de file d'attente. Un modèle speech-to-speech entend la fin de la phrase et commence à répondre dans le même flux : c'est pourquoi la conversation paraît plus fluide que ne le suggèrent les chiffres.
Ce que coûte une minute, architecture par architecture.
Coûts des modèles uniquement, tarifs publics au 15 septembre 2026. Survolez un segment pour voir sa part.
Prompt + outils (en cache après le tour 1) 0,002 $ (15 %)Entrée audio (sans cache + historique en cache) 0,003 $ (19 %)Sortie audio 0,011 $ (66 %)
Speech-to-text (Deepgram Nova-3) 0,006 $ (29 %)LLM (GPT-5.6 Luna) 0,001 $ (5 %)Text-to-speech (Cartesia Sonic) 0,014 $ (67 %)
Prompt + outils refacturés à chaque tour 0,009 $ (36 %)Historique audio relu à chaque tour 0,012 $ (45 %)Sortie audio 0,005 $ (17 %)Transcription (sortie texte) 0,000 $ (1 %)
Prompt + outils refacturés à chaque tour 0,017 $ (36 %)Historique audio relu à chaque tour 0,021 $ (45 %)Sortie audio 0,008 $ (17 %)Transcription (sortie texte) 0,001 $ (1 %)
Couche vocale GPT-Live-1 (0,05 $/min) 0,050 $ (98 %)Backend (GPT-5.6 Luna, 4 délégations) 0,001 $ (2 %)
Audio de session (tarif fixe à la minute) 0,080 $ (98 %)Éléments texte (0,004 $ chacun) 0,002 $ (2 %)
L'appel, tour par tour.
Les totaux ci-dessus sont la somme de ces tours. À chaque tour, l'appelant parle, l'architecture répond au bout de son temps de réponse (VAD compris pour le pipeline), l'agent parle, puis vient une pause. Ouvrez une architecture pour voir, tour par tour, ce qui est facturé et combien de temps dure l'attente.
Là où le verdict bascule.
Le coût par minute quand un seul réglage varie, les autres restant à vos valeurs. Le repère vertical marque votre cas d'usage.
vous · tokens du prompt : 2,6 k
Realtime-mini0,016 $
Pipeline0,020 $
Gemini 3.80,025 $
Gemini 3.10,045 $
GPT-Live-10,051 $
Grok 2.00,082 $
vous · durée d'appel : 1,9 min
Realtime-mini0,016 $
Pipeline0,020 $
Gemini 3.80,025 $
Gemini 3.10,045 $
GPT-Live-10,051 $
Grok 2.00,082 $
vous · outils : 2
Realtime-mini0,016 $
Pipeline0,020 $
Gemini 3.80,026 $
Gemini 3.10,047 $
GPT-Live-10,051 $
Grok 2.00,082 $
Les courbes du pipeline et de Realtime-mini restent plates, car leur prompt est mis en cache. Celle de Gemini Live grimpe à chaque token ajouté au prompt, à chaque outil supplémentaire et à chaque minute d'appel : l'API Live refacture tout le contexte de la session à chacun des ~5,3 tours par minute. GPT-Live-1 trace une ligne plate à 0,05 $/min, plus quelques tokens de backend ; Grok Voice 2.0 reste à 0,08 $/min, quels que soient le prompt, les outils ou les minutes.
Les principales options en un coup d'œil.
Le prix est calculé pour votre cas d'usage ; le rendu, le contrôle et le temps de réponse sont ceux de l'architecture, quel que soit le prix. Survolez une cellule pour afficher le détail.
| Architecture | $ / min | $ / appel | Sensibilité au prompt | Rendu | Voix · en | Contrôle | Temps de réponse | Index AA | Idéal pour |
|---|---|---|---|---|---|---|---|---|---|
GPT-Realtime-2.1-minila moins chère Audio natif en entrée et en sortie, mise en cache du prompt sur la session | 0,016 $ | 0,033 $ | faible | ~0,9 s1 saut · p95 1,6 s | non évalué | Flux simples où un seul fournisseur et un rendu natif priment sur le contrôle fin | |||
Pipeline Deepgram Nova-3 → GPT-5.6 Luna → Cartesia Sonic | 0,020 $ | 0,041 $ | stable | ~1,4 s4 sauts · p95 2,6 s | par composant | Volume, appels longs, prompts lourds, nombreux outils, contrôle strict | |||
Gemini 3.8 Live Audio natif en entrée et en sortie, un seul modèle ; ~44 % moins cher que Gemini 3.1 Flash Live | 0,026 $ | 0,052 $ | forte | ~0,8 s1 saut · p95 1,4 s | 76,0 | Appels courts avec un prompt compact : le rendu natif le moins cher | |||
Gemini 3.1 Flash Livemeilleur rapport qualité-prix Audio natif en entrée et en sortie, un seul modèle | 0,047 $ | 0,094 $ | forte | ~0,8 s1 saut · p95 1,4 s | 71,5 | Appels courts avec un prompt compact, là où le rendu compte le plus | |||
GPT-Live-1 + backend Couche vocale full-duplex, raisonnement délégué à un modèle texte | 0,051 $ | 0,102 $ | nulle | ~0,9 s1 saut · p95 1,8 s | 81,5 | Tâches complexes qui demandent du raisonnement, avec une facture prévisible | |||
Grok Voice 2.0 Audio natif en entrée et en sortie, tarif fixe de 0,08 $ par minute d'audio (Think Fast 2.0) | 0,082 $ | 0,164 $ | stable | ~0,7 s1 saut · p95 1,3 s | 82,9 | Appels longs ou prompts lourds à prix fixe et prévisible ; la réponse la plus rapide du comparatif |
Rendu : la fluidité et le naturel de la conversation ; le pipeline obtient 3 avec un duo STT et TTS haut de gamme, 2 sinon, et chaque note varie selon l'adéquation de la voix à la langue de l'agent (une voix de niveau natif rapporte un demi-point, un 3 en fait perdre un entier, un 2 en fait perdre deux : une mauvaise voix fait une mauvaise expérience). Voix : réputation des voix de chaque modèle dans cette langue, de 1 à 5. Contrôle : 5 pour le pipeline déterministe (température, sorties structurées, n'importe quel composant) ; les modèles speech-to-speech sont notés en proportion de leur score au Speech to Speech Index d'Artificial Analysis. Temps de réponse : délai typique entre le dernier mot de l'appelant et le premier mot de l'agent, et 95e percentile ; les sauts correspondent aux fournisseurs en série. Index AA : Speech to Speech Index d'Artificial Analysis (les pipelines sont évalués composant par composant).
Quatre situations, quatre réponses.
Ce qui fait pencher la balance : la compression de contexte de Gemini, le nombre d'outils, le rythme du dialogue et la résidence des données dans l'UE. Tous se règlent dans les paramètres avancés.
Appels courts, prompt compact
moins de 1 min · moins de 3 000 tokens · un ou deux outils
Moins d'une minute, un prompt de moins de 3 000 tokens, un ou deux outils : le speech-to-speech se situe dans la même fourchette de prix que le pipeline. Realtime-mini est généralement le moins cher de tous. Choisissez la conversation la plus fluide.
Appels longs, prompt lourd, nombreux outils
plus de 4 min · plus de 6 000 tokens · usage intensif des outils
Au-delà de 4 minutes ou de 6 000 tokens, le pipeline creuse l'écart : le prompt est mis en cache, la transcription n'est qu'un texte léger. Gemini Live coûte ici 2 à 5 fois plus cher ; GPT-Live-1 garde un coût constant, mais ne l'emporte jamais sur le prix.
Raisonnement et actions en plusieurs étapes
réservations · recherches CRM · vérifications d'identité
Réservations, recherches dans le CRM, vérifications d'identité : GPT-Live-1 associé à un backend puissant garde une voix fluide pendant que le backend réfléchit, avec un plancher prévisible de 0,05 $ la minute. Un pipeline avec un LLM puissant en fait autant, avec un contrôle total sur les appels d'outils.
Voix personnalisée ou clonée, voix de marque
la voix, c'est le produit
Les voix du speech-to-speech sont celles du modèle : Gemini 3.1 et 3.8 Live parlent désormais français ou espagnol nativement, si bien que la langue seule n'impose plus un pipeline (choisissez la langue de l'agent ci-dessus et les scores suivent). Une voix clonée, une voix de marque ou un modèle européen l'imposent encore : seul un pipeline vous permet de brancher ElevenLabs, Gradium, Cartesia ou votre propre TTS.
Pilotez CallShift depuis Claude.
Installez notre skill dans Claude et pilotez tout votre environnement en langage naturel : lister et dupliquer des agents, analyser le ROI d'une campagne, ajouter des contacts, attribuer des numéros SIP, brancher des webhooks. Elle dialogue avec notre API à votre place.
- Gère vos agents, campagnes et appels CallShift via l'API, avec une clé jetable
- Passe votre agent au crible de 140 bonnes pratiques voice AI : structure du prompt, tours de parole, STT et TTS, outils, conformité des appels sortants, maîtrise des coûts
- Conseil d'architecture : quelle famille convient à la taille de votre prompt, avec le simulateur pour les chiffres
Ajoutez-la dans Claude sous Paramètres → Capacités → Skills, ou déposez-la dans votre dossier de skills Claude Code.
Comment le simulateur calcule une minute d'appel.
Un appel est modélisé par une durée, un nombre de tours de dialogue et une part de parole : 5,3 tours de dialogue par minute par défaut, quelqu'un qui parle pendant 75 % de l'appel, l'agent pour 60 % de ce temps de parole, 3,36 tokens de texte par seconde de parole (environ 150 mots par minute) et 180 tokens par définition d'outil. Chaque architecture est chiffrée sur ce même appel, tour par tour : l'appelant parle, l'architecture répond au bout de son temps de réponse, décomposé étape par étape (VAD, STT, LLM, TTS et sauts réseau pour le pipeline ; un seul saut, interne au modèle, pour le speech-to-speech), l'agent parle, puis vient une pause. Les totaux sont la somme des tours, et la section tour par tour les détaille un à un.
- Pipeline = STT sur tout l'appel (Deepgram Nova-3 par défaut, 0,0058 $ la minute) + TTS sur la parole de l'agent (Cartesia Sonic par défaut, 0,03 $ la minute) + tokens LLM : le prompt et les définitions d'outils sans cache au premier tour, puis en cache à 10 %, l'historique de la transcription en cache, la dernière prise de parole sans cache, un aller-retour supplémentaire par appel d'outil, les mots de l'agent en sortie.
- Gemini 3.1 Flash Live = à chaque tour, le prompt et les outils en entrée texte (0,75 $ par million de tokens), plus tout l'audio échangé jusque-là en entrée audio (3 $ par million, 25 tokens par seconde), l'audio de l'agent en sortie (12 $ par million) et la transcription en sortie texte (4,50 $ par million). Pas de cache ; compression par fenêtre glissante en option.
- Gemini 3.8 Live = le même modèle de facturation, avec chaque tarif de Gemini 3.1 Flash Live multiplié par 0,56, soit le rapport entre les coûts horaires d'Artificial Analysis indiqués dans l'évaluation de Google DeepMind (0,84 $ contre 1,50 $).
- GPT-Realtime-2.1-mini = le prompt une fois sans cache (0,60 $ par million de tokens), puis en cache (0,06 $), chaque prise de parole de l'utilisateur une fois en audio sans cache (10 $ par million, 10 tokens par seconde), l'historique audio au tarif en cache (0,30 $), l'audio de l'agent en sortie (20 $ par million, 20 tokens par seconde).
- GPT-Live-1 = 0,05 $ la minute pour la couche vocale, plus une délégation au backend par minute et par appel d'outil, chacune relisant le prompt en cache et la transcription jusque-là et produisant environ 216 tokens de sortie aux tarifs du backend (GPT-5.6 Luna : 0,20 $ en entrée, 0,02 $ en cache, 1,20 $ en sortie, par million de tokens).
Seuls les coûts des modèles sont pris en compte, dans toutes les architectures. La qualité et la latence proviennent d'artificialanalysis.ai : le Speech to Speech Index (GPT-Live-1 avec GPT-6 Astra 81,5, GPT-Realtime-2.1 High 79,1, Gemini 3.8 Live 76,0, Gemini 3.1 Flash Live High 71,5) et le temps jusqu'au premier audio mesuré sur des questions de raisonnement (environ 1,3 s, 2,3 s et 3,0 s avec la réflexion activée ; sans réflexion, les tours de conversation restent bien en dessous de la seconde). Les décompositions du temps de réponse reprennent des chiffres typiques issus de benchmarks publics et de mesures terrain, et non des chiffres annoncés par les fournisseurs : le temps de réponse d'un pipeline correspond à détection de fin de tour + STT + LLM + TTS + un saut réseau par fournisseur, et ses pics de latence sont dictés par le saut le plus lent du moment. Tarifs publics vérifiés le 15 septembre 2026 ; les remises sur volume et les tarifs entreprise ne sont pas modélisés.
Questions fréquentes.
Un modèle speech-to-speech est-il moins cher qu'un pipeline STT + LLM + TTS ?
Cela dépend du modèle. Aux tarifs publics de septembre 2026, un pipeline (Deepgram Nova-3 à 0,0058 $ la minute, un LLM bon marché avec cache, Cartesia Sonic à 0,03 $ par minute de parole) coûte environ 0,02 $ par minute d'appel, quelle que soit la taille du prompt. GPT-Realtime-2.1-mini se situe dans la même fourchette. Gemini 3.1 Flash Live part plus haut et augmente avec la taille du prompt et la durée de l'appel, car il refacture tout le contexte à chaque tour. GPT-Live-1 coûte un tarif fixe de 0,05 $ la minute, plus les tokens du backend.
Pourquoi la taille de mon prompt système compte-t-elle autant avec Gemini Live ?
L'API Gemini Live n'a pas de mise en cache du prompt : à chaque tour de dialogue, elle facture en tokens d'entrée le prompt système, les définitions d'outils et tout l'audio échangé jusque-là. Un prompt de 3 000 tokens sur un appel de 2 minutes avec 11 tours est facturé 11 fois, soit 33 000 tokens, sans même compter l'audio. Un pipeline envoie lui aussi le même prompt à son LLM à chaque tour, mais la mise en cache du prompt facture le préfixe répété à 10 % du prix d'entrée.
Pourquoi la durée de l'appel change-t-elle la réponse ?
Les modèles speech-to-speech gardent toute la conversation en contexte. Chaque nouveau tour relit l'historique audio, si bien que le coût d'un tour augmente avec les minutes déjà échangées : un appel long coûte plus cher à la minute qu'un appel court. La compression de la fenêtre de contexte de Gemini Live plafonne cet historique grâce à une fenêtre glissante. Le coût d'un pipeline, lui, reste constant : le STT est facturé sur la durée de l'appel, le TTS sur les mots prononcés par l'agent, et l'historique de la transcription n'est qu'un texte léger que le cache rend presque gratuit.
Qu'est-ce que la mise en cache du prompt, et pourquoi compte-t-elle pour un agent vocal ?
Un agent vocal envoie une nouvelle requête à son modèle de langage à chaque tour de dialogue, et chaque requête transporte de nouveau tout le contexte : le prompt système, les définitions d'outils, la transcription jusque-là et la nouvelle prise de parole. Sur un appel de 11 tours, un prompt de 3 000 tokens est envoyé 11 fois. Avec la mise en cache du prompt, le fournisseur reconnaît que le début de la requête est identique à celui de la précédente et facture cette partie répétée à une fraction du prix : 10 % sur les modèles texte d'OpenAI et de Gemini, environ 3 % sur l'historique audio de Realtime. Elle fonctionne automatiquement lorsque le contenu stable (prompt, outils) vient en premier et le contenu variable (date, données de l'appelant, nouveau tour) en dernier. L'API Gemini Live n'a pas de cache, c'est pourquoi son coût grimpe avec la taille du prompt. Le simulateur applique tel quel le cache natif de chaque fournisseur : activé pour les LLM du pipeline, GPT-Realtime-mini et le backend de GPT-Live-1, jamais pour Gemini Live.
Combien de tokens compte mon prompt système ?
Collez-le dans le simulateur : il compte environ 4 caractères par token, dans votre navigateur, sans rien envoyer. Sur de la prose, les tokeniseurs de Gemini et d'OpenAI ne s'écartent que d'environ 10 % l'un de l'autre. Chaque définition d'outil ajoute environ 180 tokens (nom, description, schéma des paramètres), renvoyés à chaque tour.
À prix égal, quelle architecture choisir ?
Le speech-to-speech, pour le rendu : écoute full-duplex, prosodie naturelle, interruptions et marques d'écoute gérées par le modèle, et aucun passage de relais entre STT, LLM et TTS. La contrepartie, c'est le contrôle. Un modèle speech-to-speech se comporte comme avec une température fixée à 1 et offre peu de sorties structurées, alors qu'un pipeline vous donne une température de 0, des appels d'outils déterministes et la liberté de remplacer n'importe quel composant ou n'importe quelle voix.
Qu'est-ce que GPT-Live-1, et comment est-il facturé ?
GPT-Live-1 est le modèle speech-to-speech full-duplex d'OpenAI, sorti en septembre 2026. La couche vocale coûte un tarif fixe de 0,05 $ la minute, facturé à la seconde, silences compris, et elle délègue le raisonnement et les appels d'outils à un modèle texte en backend (GPT-5.6 Luna, Terra, Sol ou GPT-6 Astra), facturé au token avec mise en cache du prompt. Avec Astra en backend, il se classe premier au Speech to Speech Index d'Artificial Analysis, avec environ 1,3 seconde jusqu'au premier audio.
Comment Gemini 3.8 Live est-il tarifé dans le simulateur, et d'où vient le chiffre de 44 % ?
Gemini 3.8 Live est facturé comme Gemini 3.1 Flash Live : pas de mise en cache du prompt, le prompt, les outils et l'historique audio refacturés à chaque tour, mais pour environ 44 % de moins par token. Ce rapport provient de l'évaluation du modèle par Google DeepMind, qui indique le coût par heure d'audio en entrée mesuré par Artificial Analysis sur le sous-ensemble Big Bench Audio : 0,84 $ de l'heure pour Gemini 3.8 Live, contre 1,50 $ pour Gemini 3.1 Flash Live (Minimal) et 1,75 $ pour Gemini 3.1 Flash Live (High). Le simulateur applique ce rapport de 0,56 à chaque tarif par token de Gemini 3.1 Flash Live. Le même document attribue à Gemini 3.8 Live un score de 76,0 au Speech to Speech Index d'Artificial Analysis (82,6 avec la réflexion étendue), contre 71,5 pour Gemini 3.1 Flash Live (High), ainsi que le meilleur score d'expérience sur l'EVA-Bench de ServiceNow. D'après nos écoutes, il déçoit un peu sur la voix et le rendu face à Gemini 3.1 Flash Live, dont la famille de voix arrive en tête du benchmark Pronunciation Robustness d'Artificial Analysis : le simulateur note donc son rendu et sa voix en dessous de ceux de la 3.1. Aucun chiffre de latence distinct n'étant publié, le simulateur reprend la décomposition du temps de réponse de Gemini 3.1 Flash Live. Source : Évaluation du modèle Gemini 3.8 Audio (Live, Live Extended Thinking), Google DeepMind, septembre 2026.
Quel est le tarif de Grok Voice 2.0, et pourquoi est-il fixe ?
Grok Voice Think Fast 2.0, le modèle speech-to-speech de xAI lancé le 29 juillet 2026, facture 0,08 $ par minute d'audio de session (contre 0,05 $ pour la version 1.0), plus 0,004 $ par élément texte injecté dans la conversation ; les résultats des appels de fonction ne sont pas facturés. Rien ne dépend de la taille du prompt, de l'historique ou du nombre de tours, si bien que le simulateur lui applique un coût constant par minute : il n'est jamais le moins cher sur un appel court avec un prompt compact, et il l'emporte dès que les minutes ou les tokens augmentent. Artificial Analysis mesure un temps moyen de 0,70 s jusqu'au premier audio, le seul modèle du top 5 sous la seconde, et un Speech to Speech Index de 82,9 pour la variante High reasoning, qui fixe son score de contrôle. Aucune option de résidence des données dans l'UE n'est publiée. Source : Artificial Analysis, Grok Voice Think Fast 2.0 sur le Speech to Speech Index, juillet 2026.
En quoi la langue de l'agent change-t-elle la recommandation ?
Chaque modèle et chaque composant de pipeline porte une note de voix, de 1 à 5, pour l'anglais, le français, l'espagnol et le néerlandais : une réputation fondée sur des benchmarks d'écoute à l'aveugle, les listes de langues des fournisseurs et ce que nous entendons en production, et non une mesure, modifiable dans le code. Gemini 3.1 Flash Live offre la meilleure voix et le meilleur rendu du comparatif : sa famille de voix, Gemini 3.1 Flash TTS, arrive en tête du benchmark Pronunciation Robustness d'Artificial Analysis avec 88,1 % (devant SpaceXAI TTS à 87,6 % et ElevenLabs Eleven v3 à 85,6 %), le test qui vérifie que les noms, montants, dates, codes et emails sont prononcés correctement. Il obtient 5 dans toutes les langues et la meilleure note de rendu, et toutes les autres options, Gemini 3.8 Live compris, se situent un demi-point sous leur réputation sur ces deux critères. En français, Gradium, ElevenLabs et Cartesia sont les voix fortes du pipeline ; les voix d'OpenAI gardent un accent ; Grok n'a pas encore de réputation établie en français. En espagnol, Gradium et ElevenLabs sont en tête côté pipeline, suivis de Gemini 3.8 Live et des voix régionales de Grok. En néerlandais et en flamand, ElevenLabs propose des voix flamandes natives, tandis que Cartesia et Deepgram le prennent en charge avec un accent et que Gradium ne le propose pas. La note fait varier le rendu (un 5 rapporte un demi-point, un 3 en fait perdre un entier, un 2 en fait perdre deux : une mauvaise voix dans la langue de l'appelant fait une mauvaise expérience, quoi que le modèle fasse par ailleurs), une option notée sous 3 n'est pas proposée comme meilleur rapport qualité-prix tant qu'une option qui sonne mieux tient dans le budget, le choix au meilleur rapport qualité-prix en tient compte, et les listes déroulantes du pipeline affichent la note de chaque STT et TTS dans cette langue. La Belgique est couverte par le français et le néerlandais. Source : Benchmark Pronunciation Robustness d'Artificial Analysis, septembre 2026.
Puis-je conserver les données dans l'UE avec chaque architecture, et combien cela coûte-t-il ?
Oui, avec toutes sauf Grok Voice 2.0, qui n'a pas d'option UE publiée, mais à des prix différents. Gemini 3.1 Flash Live et les modèles texte Gemini tournent dans une région UE via Vertex AI au tarif régional, 10 % au-dessus de l'endpoint global. OpenAI propose des projets avec résidence des données dans l'UE : GPT-Realtime-mini et les modèles texte conservent leur prix catalogue, la couche vocale de GPT-Live-1 coûte 10 % de plus. Un pipeline est le plus simple à garder dans l'UE, car la résidence se décide composant par composant : STT et TTS sur leurs endpoints UE, le LLM sur un projet UE ou dans une région UE, et tout fournisseur qui ne peut pas s'y conformer est remplacé sans toucher au reste. Cochez la résidence des données dans l'UE dans le simulateur pour appliquer ces prix et adapter la recommandation.
Quels prix le simulateur utilise-t-il, et de quand datent-ils ?
Des tarifs publics vérifiés le 15 septembre 2026 sur les pages de tarifs de l'API Gemini et de Vertex AI, la page de tarifs de l'API OpenAI, la grille tarifaire de xAI pour Grok Voice, les pages de tarifs de Deepgram, Cartesia et Gradium (les crédits au caractère de Gradium étant convertis sur la base d'environ 900 caractères par minute parlée), et artificialanalysis.ai pour la qualité et la latence. Les remises sur volume, les contrats d'engagement et les tarifs entreprise ne sont pas modélisés. Les factures réelles varient selon le profil de la conversation : ajustez les tours par minute, la part de parole et les appels d'outils dans les paramètres avancés.
Vous avez encore des questions ?
Contactez-nous
Voyez ce que ça donne sur vos propres appels.
Réservez un appel avec un ingénieur voice AI : nous partons de vos parcours d'appel réels et vous montrons l'agent, l'architecture et les chiffres qui leur correspondent.
