¿Pipeline o speech-to-speech? Haz las cuentas.

Encuentra la mejor arquitectura de voice AI para tu caso de uso. Pega tu prompt de sistema, ajusta la duración de tus llamadas y el idioma que habla tu agente, y compara Gemini 3.8 Live, Gemini 3.1 Flash Live, GPT-Realtime-mini, Grok Voice 2.0 y GPT-Live-1 con un pipeline orquestado STT + LLM + TTS, con las tarifas públicas.

  • 6 arquitecturas
  • Precios turno a turno
  • Tiempos de respuesta desglosados
  • Nada sale de tu navegador
01 Tu caso de uso

Cuatro ajustes. Toda la página se actualiza a medida que escribes.

Pega tu prompt, ajusta la duración de la llamada, indica quién llama a quién y en qué idioma. Los precios son las tarifas públicas a 15 de septiembre de 2026, solo costes de los modelos.

configura-tu-llamadaentrante-simple
Plantilla
1Prompt de sistema≈ 4 caracteres por token
o elige un tamaño
2Duración de la llamadamedia, sin contar el tono

≈ 11 turnos de diálogo a 5,3 turnos por minuto

3Dirección
4Idioma del agentepondera las voces
Avanzado
▸Herramientas, perfil de la conversación, componentes del pipeline, backend, residencia en la UE
Herramientas
Herramientas que puede usar el agente

Cada herramienta añade unos 180 tokens de definición a cada turno

Llamadas a herramientas por llamada

Cada una añade una ida y vuelta al modelo. Auto: unas 1,5 por minuto

Conversación
Turnos por minuto

El speech-to-speech vuelve a facturar el contexto en cada turno

Proporción de la llamada con habla

El resto es silencio y tiempo de reflexión

Proporción de habla del agente

Determina el TTS y la salida de audio

Componentes del pipelineelige un componente o fija tu precio
Speech-to-text

Se factura sobre toda la llamada

LLM

Entrada / salida por 1M; el prefijo repetido se factura a la tarifa en caché (10 %)

Text-to-speech

Se factura por los minutos de habla generada

GPT-Live-1
Modelo de backend

El modelo en el que GPT-Live-1 delega el razonamiento y las herramientas

Opciones
ideal-para-tu-llamadaentrante · 2 min · 3000 tok
Mejor relación calidad-precioSpeech-to-speechentrante · naturalidad ante todo

Gemini 3.1 Flash Live

0,047 $/mincoste por minuto
0,094 $por llamada de 2 min
~0,8 srespuesta · 1 salto
naturalidad control voz · en p95 1,4 s
Por qué

+187 % respecto a la opción más barata (GPT-Realtime-2.1-mini), a cambio de una conversación más fluida y una respuesta más rápida (~0,8 s frente a ~0,9 s): un solo salto, sin traspasos STT → LLM → TTS. Son 0,061 $ más por llamada. Ese sobrecoste te da la mejor voz del mercado: la familia de voces de Gemini 3.1 lidera el benchmark Pronunciation Robustness de Artificial Analysis (88,1 %), así que nombres, importes, fechas y emails se pronuncian correctamente. La máxima naturalidad justifica un +100 % de presupuesto adicional en llamadas entrantes. Contrapartida: control 3,5/5. El speech-to-speech se comporta como con una temperatura fija de 1; reserva el pipeline para un uso determinista de herramientas.

Otras arquitecturas a tener en cuenta
Más barata · GPT-Realtime-2.1-mini0,016 $/min−65 %~0,9 s
Pipeline0,020 $/min−57 %~1,4 s
Gemini 3.8 Live0,026 $/min−44 %~0,8 s

Diferencia de precio frente a la mejor relación calidad-precio; pasa el cursor sobre la más barata para ver por qué gana en precio.

Gratis, 15 min. Trae tu prompt y llévate tu arquitectura.

Crear una cuenta
02 Tiempo de respuesta

Por qué el speech-to-speech se percibe más rápido.

De la última palabra de quien llama a la primera del agente. Un pipeline encadena cuatro proveedores, cada uno un salto de red con su propia cola: los retardos se suman, y el salto más lento del momento marca los picos de latencia. El speech-to-speech es un modelo, un salto.

Grok Voice 2.01 salto~0,7 s típico · p95 1,3 s

Fin del habla, en el modelo 200 msPrimer audio 500 ms

Gemini 3.1 Flash Live1 salto~0,8 s típico · p95 1,4 s

Fin del habla, en el modelo 250 msPrimer audio 500 ms

Gemini 3.8 Live1 salto~0,8 s típico · p95 1,4 s

Fin del habla, en el modelo 250 msPrimer audio 500 ms

GPT-Realtime-2.1-mini1 salto~0,9 s típico · p95 1,6 s

Fin del habla, en el modelo 300 msPrimer audio 600 ms

GPT-Live-1 + backend1 salto~0,9 s típico · p95 1,8 s

Full-duplex, sin detección explícita de turnos 200 msPrimer audio (el backend razona en paralelo) 700 ms

Pipeline4 saltos~1,4 s típico · p95 2,6 s

VAD: espera de silencio + fin de turno 400 msTranscripción final del STT 250 msPrimer token del LLM 350 msPrimer audio del TTS 200 msSobrecarga de los saltos (red, colas) 200 ms

Cifras típicas de benchmarks públicos y mediciones de campo, no cifras de los proveedores. La suma de las latencias que anuncian los proveedores es un mínimo: la detección de fin de turno tiene que esperar al silencio, la transcripción tiene que ser definitiva antes de que arranque el LLM, el primer token tiene que llegar antes de que el TTS pueda hablar, y cada salto añade tiempo de serialización, de red y de cola. Un modelo speech-to-speech oye el final de la frase y empieza a responder en el mismo flujo, y por eso la conversación resulta más fluida de lo que sugieren las cifras.

03 Coste por minuto

Lo que cuesta un minuto, por arquitectura.

Solo costes de los modelos, tarifas públicas a 15 de septiembre de 2026. Pasa el cursor sobre un segmento para ver su porcentaje.

GPT-Realtime-2.1-miniSpeech-to-speechmás barata0,016 $ / min

Prompt + herramientas (en caché tras el turno 1) 0,002 $ (15 %)Entrada de audio (sin caché + historial en caché) 0,003 $ (19 %)Salida de audio 0,011 $ (66 %)

PipelinePipeline0,020 $ / min

Speech-to-text (Deepgram Nova-3) 0,006 $ (29 %)LLM (GPT-5.6 Luna) 0,001 $ (5 %)Text-to-speech (Cartesia Sonic) 0,014 $ (67 %)

Gemini 3.8 LiveSpeech-to-speech0,026 $ / min

Prompt + herramientas, facturados de nuevo en cada turno 0,009 $ (36 %)Historial de audio, releído en cada turno 0,012 $ (45 %)Salida de audio 0,005 $ (17 %)Transcripción (salida de texto) 0,000 $ (1 %)

Gemini 3.1 Flash LiveSpeech-to-speech0,047 $ / min

Prompt + herramientas, facturados de nuevo en cada turno 0,017 $ (36 %)Historial de audio, releído en cada turno 0,021 $ (45 %)Salida de audio 0,008 $ (17 %)Transcripción (salida de texto) 0,001 $ (1 %)

GPT-Live-1 + backendSpeech-to-speech + LLM0,051 $ / min

Capa de voz de GPT-Live-1 (0,05 $/min) 0,050 $ (98 %)Backend (GPT-5.6 Luna, 4 delegaciones) 0,001 $ (2 %)

Grok Voice 2.0Speech-to-speech0,082 $ / min

Audio de sesión (tarifa fija por minuto) 0,080 $ (98 %)Elementos de texto (0,004 $ cada uno) 0,002 $ (2 %)

04 Detalle del cálculo

La llamada, turno a turno.

Los totales de arriba son la suma de estos turnos. En cada turno, quien llama habla, la arquitectura responde tras su tiempo de respuesta, desglosado etapa por etapa (VAD incluido en el pipeline), el agente habla y luego viene una pausa. Abre una arquitectura para ver lo que factura cada turno y cuánto espera.

05 Sensibilidad

Dónde cambia la respuesta.

Coste por minuto cuando un ajuste varía y los demás se quedan en tus valores. La línea vertical marca tu caso de uso.

PipelineGemini 3.1 Flash LiveGemini 3.8 LiveGPT-Realtime-2.1-miniGrok Voice 2.0GPT-Live-1 + backend
Según el tamaño del prompt de sistema
0 $0,050 $0,10 $0,15 $10010,1k20ktokens del prompt

tu caso · tokens del prompt: 2,6k

Realtime-mini0,016 $

Pipeline0,020 $

Gemini 3.80,025 $

Gemini 3.10,045 $

GPT-Live-10,051 $

Grok 2.00,082 $

Por duración de llamada
0 $0,050 $0,10 $0,15 $15 s5,1 min10 minduración de llamada

tu caso · duración de llamada: 1,9 min

Realtime-mini0,016 $

Pipeline0,020 $

Gemini 3.80,025 $

Gemini 3.10,045 $

GPT-Live-10,051 $

Grok 2.00,082 $

Por número de herramientas
0 $0,025 $0,050 $0,075 $0,10 $02040herramientas

tu caso · herramientas: 2

Realtime-mini0,016 $

Pipeline0,020 $

Gemini 3.80,026 $

Gemini 3.10,047 $

GPT-Live-10,051 $

Grok 2.00,082 $

El pipeline y Realtime-mini se mantienen planos porque su prompt está en caché. Gemini Live sube con cada token que añades al prompt, cada herramienta adicional y cada minuto de llamada: la API Live vuelve a facturar todo el contexto de la sesión en cada uno de los ~5,3 turnos por minuto. GPT-Live-1 es una línea plana a 0,05 $/min más unos pocos tokens de backend; Grok Voice 2.0 se mantiene plano a 0,08 $/min, independientemente del prompt, las herramientas o los minutos.

06 Cara a cara

Las principales opciones de un vistazo.

Precio para tu caso de uso; la naturalidad, el control y el tiempo de respuesta son lo que obtienes, sea cual sea el precio. Pasa el cursor sobre una celda para ver el detalle.

Arquitectura$ / min$ / llamadaSensibilidad al promptNaturalidadVoz · enControlTiempo de respuestaÍndice AAIdeal para

GPT-Realtime-2.1-minimás barata

Audio nativo de entrada y salida, caché de prompts en la sesión

0,016 $0,033 $baja~0,9 s1 salto · p95 1,6 ssin puntuaciónFlujos simples donde un único proveedor y el audio nativo pesan más que el control fino

Pipeline

Deepgram Nova-3 → GPT-5.6 Luna → Cartesia Sonic

0,020 $0,041 $estable~1,4 s4 saltos · p95 2,6 spor componenteVolumen, llamadas largas, prompts pesados, muchas herramientas, control estricto

Gemini 3.8 Live

Audio nativo de entrada y de salida, un solo modelo; ~44 % más barato que Gemini 3.1 Flash Live

0,026 $0,052 $alta~0,8 s1 salto · p95 1,4 s76,0Llamadas cortas con un prompt compacto: el audio nativo más barato

Gemini 3.1 Flash Livemejor calidad-precio

Audio nativo de entrada y de salida, un solo modelo

0,047 $0,094 $alta~0,8 s1 salto · p95 1,4 s71,5Llamadas cortas con un prompt compacto, donde la naturalidad es lo que más cuenta

GPT-Live-1 + backend

Capa de voz full-duplex, razonamiento delegado en un modelo de texto

0,051 $0,102 $nula~0,9 s1 salto · p95 1,8 s81,5Tareas complejas que requieren razonamiento, con una factura previsible

Grok Voice 2.0

Audio nativo de entrada y salida, tarifa fija de 0,08 $ por minuto de audio (Think Fast 2.0)

0,082 $0,164 $estable~0,7 s1 salto · p95 1,3 s82,9Llamadas largas o prompts pesados a un precio fijo y previsible; la respuesta más rápida del mercado

Naturalidad: lo fluida y natural que suena la conversación; el pipeline obtiene un 3 con un par STT y TTS premium, y un 2 en caso contrario, y cada puntuación varía según cómo encaje la voz en el idioma del agente (una voz de calidad nativa suma medio punto, un 3 resta un punto entero, un 2 resta dos: una mala voz es una mala experiencia). Voz: reputación de las voces de cada modelo en ese idioma, de 1 a 5. Control: 5 para el pipeline determinista (temperatura, salida estructurada, cualquier componente); los modelos speech-to-speech se puntúan en proporción a su Speech to Speech Index de Artificial Analysis. Tiempo de respuesta: retardo típico entre la última palabra de quien llama y la primera del agente, y el percentil 95; los saltos son los proveedores en serie. Índice AA: Speech to Speech Index de Artificial Analysis (los pipelines se puntúan por componente).

ambos conservan tus ajustes exactos

mejor calidad-precio

Gemini 3.1 · 0,047 $/min · ~0,8 s

07 La mejor opción según el caso

Cuatro situaciones, cuatro respuestas.

Lo que inclina la balanza: la compresión de contexto de Gemini, el número de herramientas, el ritmo del diálogo y la residencia de datos en la UE. Todo ello se configura en los ajustes avanzados.

Llamadas cortas, prompt compacto

menos de 1 min · menos de 3.000 tokens · un par de herramientas

Menos de un minuto, un prompt de menos de 3.000 tokens, un par de herramientas: el speech-to-speech está en la misma franja de precio que el pipeline. Realtime-mini suele ser el más barato de todos. Quédate con la conversación más fluida.

1 saltoapuesta por la naturalidad

Llamadas largas, prompt pesado, muchas herramientas

más de 4 min · más de 6.000 tokens · uso intensivo de herramientas

A partir de 4 minutos o 6.000 tokens, el pipeline se distancia: el prompt está en caché y la transcripción es un texto ligero. Aquí Gemini Live cuesta de 2 a 5 veces más; GPT-Live-1 mantiene un coste constante, pero nunca gana en precio.

2 a 5×más caro con Gemini Live

Razonamiento y acciones en varios pasos

reservas · consultas al CRM · verificaciones de identidad

Reservas, consultas al CRM, verificaciones de identidad: GPT-Live-1 con un backend potente mantiene la voz fluida mientras el backend razona, con un mínimo previsible de 0,05 $ por minuto. Un pipeline con un LLM potente hace lo mismo, con control total sobre las llamadas a herramientas.

0,05 $por minuto, mínimo fijo

Voz personalizada o clonada, voz de marca

la voz es el producto

Las voces del speech-to-speech son las del propio modelo: Gemini 3.1 y 3.8 Live ya hablan francés o español de forma nativa, así que el idioma por sí solo ya no obliga a usar un pipeline (elige el idioma del agente arriba y las puntuaciones se ajustan). Una voz clonada, una voz de marca o un modelo europeo siguen obligando a ello: solo un pipeline te permite conectar ElevenLabs, Gradium, Cartesia o tu propio TTS.

cualquier TTSsolo en pipeline
08 skill de Claude

Pilota CallShift desde Claude.

Instala nuestra skill en Claude y pilota todo tu entorno en lenguaje natural: listar y duplicar agentes, analizar el ROI de una campaña, añadir contactos, asignar números SIP, conectar webhooks. La skill habla con nuestra API por ti.

  • Gestiona tus agentes, campañas y llamadas de CallShift a través de la API, con una clave desechable
  • Evalúa tu agente según 140 buenas prácticas de voice AI: estructura del prompt, turnos de palabra, STT y TTS, herramientas, cumplimiento en llamadas salientes, control de costes
  • Asesoría de arquitectura: qué familia encaja con el tamaño de tu prompt, con el simulador para las cifras
Gratis · funciona en Claude y Claude Code · EN, FR, ES

Añádela en Claude en Configuración → Capacidades → Skills, o colócala en tu carpeta de skills de Claude Code.

09 Método

Cómo calcula el simulador un minuto de llamada.

Una llamada se modela con una duración, un número de turnos de diálogo y una proporción de habla: 5,3 turnos de diálogo por minuto por defecto, alguien hablando durante el 75 % de la llamada, el agente durante el 60 % de ese tiempo de habla, 3,36 tokens de texto por segundo de habla (unas 150 palabras por minuto) y 180 tokens por definición de herramienta. El coste de cada arquitectura se calcula sobre esa misma llamada, turno a turno: la persona que llama habla, la arquitectura responde tras su tiempo de respuesta, desglosado etapa por etapa (VAD, STT, LLM, TTS y saltos de red en el pipeline; un único salto, dentro del modelo, en el speech-to-speech), el agente habla y luego viene una pausa. Los totales son la suma de los turnos, y la sección turno a turno los muestra uno por uno.

  • Pipeline = STT sobre toda la llamada (Deepgram Nova-3 por defecto, 0,0058 $ por minuto) + TTS sobre el habla del agente (Cartesia Sonic por defecto, 0,03 $ por minuto) + tokens del LLM: el prompt y las definiciones de herramientas sin caché en el primer turno y luego en caché al 10 %, el historial de la transcripción en caché, la última intervención sin caché, una ida y vuelta adicional por cada llamada a herramienta y las palabras del agente como salida.
  • Gemini 3.1 Flash Live = en cada turno, el prompt y las herramientas como entrada de texto (0,75 $ por millón de tokens), más todo el audio acumulado hasta ese momento como entrada de audio (3 $ por millón, 25 tokens por segundo), el audio del agente como salida (12 $ por millón) y la transcripción como salida de texto (4,50 $ por millón). Sin caché; compresión opcional por ventana deslizante.
  • Gemini 3.8 Live = el mismo modelo de facturación, con cada tarifa de Gemini 3.1 Flash Live multiplicada por 0,56, la relación entre los costes por hora de Artificial Analysis indicados en la evaluación de Google DeepMind (0,84 $ frente a 1,50 $).
  • GPT-Realtime-2.1-mini = el prompt una vez sin caché (0,60 $ por millón de tokens) y luego en caché (0,06 $), cada intervención del usuario una vez como audio sin caché (10 $ por millón, 10 tokens por segundo), el historial de audio a la tarifa en caché (0,30 $) y el audio del agente como salida (20 $ por millón, 20 tokens por segundo).
  • GPT-Live-1 = 0,05 $ por minuto por la capa de voz, más una delegación al backend por minuto y por llamada a herramienta, cada una releyendo el prompt en caché y la transcripción hasta ese momento y generando unos 216 tokens de salida a las tarifas del backend (GPT-5.6 Luna: 0,20 $ de entrada, 0,02 $ en caché y 1,20 $ de salida por millón de tokens).

Solo se cuentan los costes de los modelos, en todas las arquitecturas. La calidad y la latencia proceden de artificialanalysis.ai: el Speech to Speech Index (GPT-Live-1 con GPT-6 Astra 81,5, GPT-Realtime-2.1 High 79,1, Gemini 3.8 Live 76,0, Gemini 3.1 Flash Live High 71,5) y el tiempo hasta el primer audio medido en preguntas de razonamiento (unos 1,3 s, 2,3 s y 3,0 s con el razonamiento activado; sin razonamiento, los turnos de conversación quedan muy por debajo del segundo). Los desgloses del tiempo de respuesta son cifras típicas de benchmarks públicos y mediciones de campo, no cifras de los proveedores: el tiempo de respuesta de un pipeline es detección de fin de turno + STT + LLM + TTS + un salto de red por proveedor, y sus picos de latencia los marca el salto más lento del momento. Tarifas públicas comprobadas el 15 de septiembre de 2026; los descuentos por volumen y las tarifas empresariales no se modelan.

10 Preguntas

Preguntas frecuentes.

¿Es un modelo speech-to-speech más barato que un pipeline STT + LLM + TTS?

Depende del modelo. Con las tarifas públicas de septiembre de 2026, un pipeline (Deepgram Nova-3 a 0,0058 $ por minuto, un LLM barato con caché, Cartesia Sonic a 0,03 $ por minuto de habla) cuesta unos 0,02 $ por minuto de llamada, sea cual sea el tamaño del prompt. GPT-Realtime-2.1-mini queda en el mismo rango. Gemini 3.1 Flash Live parte de más arriba y sube con el tamaño del prompt y la duración de la llamada, porque vuelve a facturar todo el contexto en cada turno. GPT-Live-1 tiene una tarifa fija de 0,05 $ por minuto, más los tokens del backend.

¿Por qué importa tanto el tamaño de mi prompt de sistema en Gemini Live?

La API de Gemini Live no tiene caché de prompts: en cada turno de diálogo factura como tokens de entrada el prompt de sistema, las definiciones de herramientas y todo el audio intercambiado hasta ese momento. Un prompt de 3.000 tokens en una llamada de 2 minutos con 11 turnos se factura 11 veces, 33.000 tokens, sin contar todavía el audio. Un pipeline también envía el mismo prompt a su LLM en cada turno, pero la caché de prompts factura el prefijo repetido al 10 % del precio de entrada.

¿Por qué la duración de la llamada cambia la respuesta?

Los modelos speech-to-speech mantienen toda la conversación en contexto. Cada nuevo turno vuelve a leer el historial de audio, así que el coste de un turno crece con los minutos ya hablados: una llamada larga cuesta más por minuto que una corta. La compresión de la ventana de contexto de Gemini Live limita ese historial con una ventana deslizante. Un pipeline, en cambio, tiene un coste constante: el STT se factura por la duración de la llamada, el TTS por las palabras que dice el agente, y el historial de la transcripción es un texto ligero que la caché hace casi gratuito.

¿Qué es la caché de prompts y por qué importa en un agente de voz?

Un agente de voz envía una nueva solicitud a su modelo de lenguaje en cada turno de diálogo, y cada solicitud vuelve a llevar todo el contexto: el prompt de sistema, las definiciones de herramientas, la transcripción hasta ese momento y la nueva intervención. En una llamada de 11 turnos, un prompt de 3.000 tokens se envía 11 veces. Con la caché de prompts, el proveedor reconoce que el principio de la solicitud es idéntico al de la anterior y factura esa parte repetida a una fracción del precio: el 10 % en los modelos de texto de OpenAI y Gemini, alrededor del 3 % en el historial de audio de Realtime. Funciona automáticamente cuando el contenido estable (prompt, herramientas) va primero y el contenido variable (fecha, datos de quien llama, nuevo turno) al final. La API de Gemini Live no tiene caché, y por eso su coste sube con el tamaño del prompt. El simulador aplica tal cual la caché nativa de cada proveedor: activada para los LLM del pipeline, GPT-Realtime-mini y el backend de GPT-Live-1, nunca para Gemini Live.

¿Cuántos tokens tiene mi prompt de sistema?

Pégalo en el simulador: cuenta unos 4 caracteres por token, en tu navegador, sin enviar nada. En prosa, los tokenizadores de Gemini y OpenAI difieren entre sí en torno a un 10 %. Cada definición de herramienta añade unos 180 tokens (nombre, descripción, esquema de parámetros) que viajan en cada turno.

A igual precio, ¿qué arquitectura debo elegir?

La de speech-to-speech, por la naturalidad: escucha full-duplex, prosodia natural, interrupciones y señales de escucha gestionadas por el modelo, y sin traspasos de STT a LLM y de LLM a TTS. La contrapartida es el control. Un modelo speech-to-speech se comporta como con una temperatura fija de 1 y ofrece poca salida estructurada, mientras que un pipeline te da temperatura 0, llamadas a herramientas deterministas y la libertad de cambiar cualquier componente o voz.

¿Qué es GPT-Live-1 y cómo se factura?

GPT-Live-1 es el modelo speech-to-speech full-duplex de OpenAI lanzado en septiembre de 2026. La capa de voz cuesta una tarifa fija de 0,05 $ por minuto, facturada por segundo, silencios incluidos, y delega el razonamiento y las llamadas a herramientas en un modelo de texto de backend (GPT-5.6 Luna, Terra, Sol o GPT-6 Astra) facturado por token con caché de prompts. Con Astra como backend, ocupa el primer puesto del Speech to Speech Index de Artificial Analysis, con unos 1,3 segundos hasta el primer audio.

¿Cómo se tarifica Gemini 3.8 Live en el simulador y de dónde sale el 44 %?

Gemini 3.8 Live se factura como Gemini 3.1 Flash Live: sin caché de prompts, con el prompt, las herramientas y el historial de audio facturados de nuevo en cada turno, pero alrededor de un 44 % más barato por token. La relación procede de la evaluación del modelo de Google DeepMind, que indica el coste por hora de audio de entrada medido por Artificial Analysis en el subconjunto Big Bench Audio: 0,84 $ por hora para Gemini 3.8 Live frente a 1,50 $ para Gemini 3.1 Flash Live (Minimal) y 1,75 $ para Gemini 3.1 Flash Live (High). El simulador aplica esa relación de 0,56 a cada tarifa por token de Gemini 3.1 Flash Live. El mismo documento otorga a Gemini 3.8 Live una puntuación de 76,0 en el Speech to Speech Index de Artificial Analysis (82,6 con razonamiento extendido) frente a 71,5 de Gemini 3.1 Flash Live (High), y la mejor puntuación de experiencia en el EVA-Bench de ServiceNow. En nuestras escuchas resulta algo decepcionante en voz y naturalidad frente a Gemini 3.1 Flash Live, cuya familia de voces lidera el benchmark Pronunciation Robustness de Artificial Analysis, así que el simulador puntúa su naturalidad y su voz por debajo de las de la 3.1. Como no se ha publicado una cifra de latencia propia, se reutiliza el desglose del tiempo de respuesta de Gemini 3.1 Flash Live. Fuente: Evaluación del modelo Gemini 3.8 Audio (Live, Live Extended Thinking), Google DeepMind, septiembre de 2026.

¿Cuál es la tarifa de Grok Voice 2.0 y por qué es fija?

Grok Voice Think Fast 2.0, el modelo speech-to-speech de xAI lanzado el 29 de julio de 2026, factura 0,08 $ por minuto de audio de sesión (frente a 0,05 $ en la versión 1.0), más 0,004 $ por cada elemento de texto inyectado en la conversación; los resultados de las llamadas a funciones no se facturan. Nada depende del tamaño del prompt, del historial ni del número de turnos, así que el simulador le asigna un coste constante por minuto: nunca es el más barato en una llamada corta con un prompt compacto, y gana en cuanto crecen los minutos o los tokens. Artificial Analysis mide un tiempo medio de 0,70 s hasta el primer audio, el único modelo del top 5 por debajo del segundo, y un Speech to Speech Index de 82,9 para la variante High reasoning, que fija su puntuación de control. No se ha publicado ninguna opción de residencia de datos en la UE. Fuente: Artificial Analysis, Grok Voice Think Fast 2.0 en el Speech to Speech Index, julio de 2026.

¿Cómo cambia la recomendación según el idioma del agente?

Cada modelo y cada componente del pipeline lleva una puntuación de voz, de 1 a 5, para inglés, francés, español y neerlandés: una reputación basada en benchmarks de escucha a ciegas, las listas de idiomas de los proveedores y lo que oímos en producción, no una medición, y editable en el código. Gemini 3.1 Flash Live tiene la mejor voz y la mayor naturalidad del mercado: su familia de voces, Gemini 3.1 Flash TTS, lidera el benchmark Pronunciation Robustness de Artificial Analysis con un 88,1 % (por delante de SpaceXAI TTS con un 87,6 % y ElevenLabs Eleven v3 con un 85,6 %), la prueba que comprueba si nombres, importes, fechas, códigos y emails se pronuncian correctamente. Obtiene un 5 en todos los idiomas y la máxima naturalidad, y todas las demás opciones, Gemini 3.8 Live incluido, quedan medio punto por debajo de su reputación en ambos aspectos. En francés, Gradium, ElevenLabs y Cartesia son las voces fuertes del pipeline; las voces de OpenAI conservan acento; Grok aún no tiene una reputación establecida en francés. En español, Gradium y ElevenLabs lideran el pipeline, seguidos de Gemini 3.8 Live y las voces regionales de Grok. En neerlandés y flamenco, ElevenLabs tiene voces flamencas nativas, mientras que Cartesia y Deepgram lo admiten con acento y Gradium no lo ofrece. La puntuación modifica la naturalidad (un 5 suma medio punto, un 3 resta un punto entero, un 2 resta dos: una mala voz en el idioma de quien llama es una mala experiencia, haga lo que haga el modelo en lo demás), una opción con menos de 3 no se propone como la de mejor relación calidad-precio mientras otra que suene mejor quepa en el presupuesto, la recomendación de mejor relación calidad-precio se ajusta en consecuencia, y los selectores del pipeline muestran la puntuación de cada STT y TTS en ese idioma. Bélgica queda cubierta con el francés y el neerlandés. Fuente: Benchmark Pronunciation Robustness de Artificial Analysis, septiembre de 2026.

¿Puedo mantener los datos en la UE con cada arquitectura y cuánto cuesta?

Sí, con todas salvo Grok Voice 2.0, que no tiene una opción en la UE publicada, aunque a precios distintos. Gemini 3.1 Flash Live y los modelos de texto de Gemini funcionan en una región de la UE a través de Vertex AI con precios regionales, un 10 % por encima del endpoint global. OpenAI ofrece proyectos con residencia de datos en la UE: GPT-Realtime-mini y los modelos de texto mantienen su precio de tarifa, y la capa de voz de GPT-Live-1 cuesta un 10 % más. Un pipeline es lo más fácil de mantener en la UE porque la residencia se decide componente por componente: STT y TTS en sus endpoints de la UE, el LLM en un proyecto o una región de la UE, y cualquier proveedor que no pueda cumplir se sustituye sin tocar el resto. Marca la residencia de datos en la UE en el simulador para aplicar estos precios y adaptar la recomendación.

¿Qué precios utiliza el simulador y de cuándo son?

Tarifas públicas comprobadas el 15 de septiembre de 2026 en las páginas de precios de la API de Gemini y de Vertex AI, la página de precios de la API de OpenAI, los precios de xAI para Grok Voice, las páginas de precios de Deepgram, Cartesia y Gradium (los créditos por carácter de Gradium se convierten a razón de unos 900 caracteres por minuto hablado) y artificialanalysis.ai para la calidad y la latencia. Los descuentos por volumen, los contratos de uso comprometido y las tarifas empresariales no se modelan. Las facturas reales varían según el perfil de la conversación: ajusta los turnos por minuto, la proporción de habla y las llamadas a herramientas en los ajustes avanzados.

¿Aún tienes preguntas?

Contáctanos

Contacto
Siguiente paso

Míralo funcionando con tus propias llamadas.

Reserva una llamada con un ingeniero de voice AI: partimos de tus flujos de llamadas reales y te enseñamos el agente, la arquitectura y las cifras que encajan con ellos.

1:1con un ingeniero de voice AI, sin diapositivas
2arquitecturas que llevamos a producción: speech-to-speech y pipelines
1plan de despliegue para llevarte: volumen, precios, telefonía