01 Funcionalidad

Agentes de voz con IA, en speech-to-speech o en pipeline.

CallShift opera agentes telefónicos con IA sobre modelos speech-to-speech nativos (Gemini Live, GPT-Live y Realtime de OpenAI, Grok Voice) y sobre pipelines STT → LLM → TTS, y elige la arquitectura caso de uso por caso de uso. Ambas arquitecturas están en producción desde 2024 y se han comparado en una prueba A/B sobre una campaña real.

01 Definición

¿Qué es un agente de voz speech-to-speech?

Un agente de voz speech-to-speech es un agente telefónico con IA construido sobre un único modelo que oye el audio y responde en audio, sin transcripción ni voz separada de por medio. Un agente de voz en pipeline, en cambio, encadena tres modelos: speech-to-text (STT), un gran modelo de lenguaje (LLM) y text-to-speech (TTS).

La diferencia está en lo que oye la persona que llama y en lo que tú controlas. El speech-to-speech conserva el tono, las vacilaciones y las interrupciones, y responde en un solo salto. Un pipeline convierte cada turno en texto que se puede inspeccionar, restringir y reproducir, a costa de más saltos y de una conversación que avanza por turnos.

  • ~0,8 stiempo de respuesta típico en speech-to-speech, p95 1,4 s
  • ~1,4 stiempo de respuesta típico en pipeline, p95 2,6 s
  • ~20 %más de rendimiento para el speech-to-speech en la prueba A/B de uMinds en producción

Actualizado el 29 de septiembre de 2026

02 Arquitectura

¿Orquestación de pipeline o speech-to-speech? La decisión se toma caso de uso por caso de uso.

Dos arquitecturas de voice AI, dos promesas opuestas. La orquestación de pipeline (STT → LLM → TTS) convierte cada turno de palabra en texto: eso es determinismo. El speech-to-speech nativo mantiene el audio de extremo a extremo: eso es look & feel. Ninguna gana en todo, y acertar en ese arbitraje, mucho más que el modelo, es lo que decide un despliegue.

Una de nuestras especialidades

Orquestación de pipeline · STT → LLM → TTS

Prioriza el determinismo.

El texto intermedio es un punto de control: lo que se transcribe se inspecciona, se restringe y se reproduce igual.

  • Flujos complejos de tool-calling, ramificaciones condicionales, formularios largos
  • Guiones restringidos donde cada mención debe decirse tal cual
  • Cada capa se elige y se cambia por separado: STT, LLM, voz
  • Transcripción nativa: auditoría, control de calidad y revisión de llamadas trazables

Speech-to-speech nativo · audio → audio

Prioriza el look & feel.

Un único bucle de audio nativo, sin capa de transcripción: el modelo oye el tono y responde con el suyo.

  • Recepción, cualificación, seguimiento: allí donde la naturalidad convierte
  • Latencia baja, interrupciones limpias, matiz emocional oído y devuelto
  • Emails y números de teléfono capturados sin transcriptor que los estropee
  • Tono, acento y estilo dirigidos desde el prompt, sobre la marcha
Tiempo de respuesta, desde la última palabra de la persona que llama
Pipeline4 saltos~1,4 s típico · p95 2,6 s

VAD 400 ms · STT 250 ms · LLM 350 ms · TTS 200 ms · saltos 200 ms

Speech-to-speech1 salto~0,8 s típico · p95 1,4 s

fin del habla 250 ms · primer audio 500 ms

Cifras típicas de benchmarks públicos y mediciones de campo, con el percentil 95 señalado; cada salto añade su propia cola.

En una prueba A/B cara a cara en producción real, los agentes speech-to-speech en español de uMinds quedaron alrededor de un 20 % por delante del pipeline Cartesia + GPT-4.1 mini + Deepgram que operaban antes. Ver el caso de uMinds

“Con apuestas sólidas por modelos como Gemini, han logrado la calidad y los precios que nos hicieron dejar a otros proveedores.”

Francesco Haces MunozCofundador, uMinds
Abrir el simulador
03 Casos de uso

¿Qué arquitectura para qué llamada?

La decisión se toma flujo por flujo, no una vez por empresa. Lo que elegimos y por qué.

Flujo de llamadasArquitecturaPor qué
Recepción, centralita, línea fuera de horarioSpeech-to-speechRespuestas rápidas, interrupciones limpias y naturalidad: las personas que llaman no cuelgan.
Cualificación de leads, seguimientos, campañas salientesSpeech-to-speechAllí donde la naturalidad convierte: alrededor de un 20 % por delante del pipeline en la prueba A/B de uMinds.
Captura de emails, números de teléfono y códigosSpeech-to-speechSin transcriptor de por medio que los estropee.
Formularios largos, ramificaciones condicionales, muchas herramientasPipelineUso determinista de herramientas y salidas estructuradas, con cualquier LLM.
Guiones regulados que deben decirse tal cualPipelineEl texto intermedio es un punto de control: cada mención se comprueba antes de decirse.
Razonamiento complejo con una voz naturalSpeech-to-speech + LLMUna capa de voz full-duplex mantiene la conversación mientras un modelo de texto razona y llama a las herramientas.
Llamadas largas, prompts pesados, factura previsiblePipeline o speech-to-speech con tarifa fijaLos modelos de audio nativos que vuelven a facturar todo el contexto en cada turno cuestan más a medida que la llamada se alarga.
Datos conservados en la UEPipeline, o Gemini Live y OpenAI en endpoints de la UEResidencia de datos componente por componente; Grok Voice aún no ha publicado una opción en la UE.
04 Modelos

Los modelos que usamos en producción.

Todos los modelos de nuestro simulador de arquitectura funcionan en producción en CallShift. Puntuaciones a 15 de septiembre de 2026.

ModeloTipoSpeech to Speech IndexRespuesta típicaIdeal para
Gemini 3.1 Flash LiveSpeech-to-speech71.5~0,8 sLlamadas cortas con un prompt compacto, donde la naturalidad es lo que más cuenta
Gemini 3.8 LiveSpeech-to-speech76.0~0,8 sLlamadas cortas con un prompt compacto: el audio nativo más barato
GPT-Realtime-2.1-miniSpeech-to-speechsin puntuación~0,9 sFlujos simples donde un único proveedor y el audio nativo pesan más que el control fino
Grok Voice 2.0Speech-to-speech82.9~0,7 sLlamadas largas o prompts pesados a un precio fijo y previsible; la respuesta más rápida del mercado
GPT-Live-1 + backendSpeech-to-speech + LLM81.5~0,9 sTareas complejas que requieren razonamiento, con una factura previsible

Componentes del pipeline

Speech-to-text
Deepgram Nova-3 · AssemblyAI Universal-Streaming · ElevenLabs Scribe v2 Realtime · OpenAI gpt-4o-mini-transcribe · Gradium STT
LLM
GPT-5.6 Luna · GPT-4.1 mini · Gemini 3.8 Flash · Gemini 3.1 Flash-Lite · GPT-5.6 Terra
Text-to-speech
Cartesia Sonic · Inworld TTS 1.5 · Deepgram Aura-2 · ElevenLabs Flash v2.5 · OpenAI gpt-4o-mini-tts · Gradium TTS

Speech to Speech Index de Artificial Analysis. Tiempo de respuesta típico desde la última palabra de la persona que llama hasta el primer audio del agente, según benchmarks públicos y mediciones de campo.

Prueba tu prompt
05 Preguntas

Voice AI speech-to-speech: tus preguntas, nuestras respuestas.

¿Está listo el speech-to-speech para llamadas telefónicas en producción?

Sí. uMinds hace llamadas de venta en español con Gemini 3.1 Flash Live a través de CallShift: 50.000 llamadas completadas en menos de 3 horas en su propio SIP, tras una prueba A/B en producción que situó el speech-to-speech alrededor de un 20 % por delante de su pipeline Deepgram + GPT-4.1 mini + Cartesia. Leer el caso de uMinds.

¿Con qué rapidez responde un agente de voz speech-to-speech?

Normalmente en unos 0,8 s desde la última palabra de la persona que llama, 1,4 s en el percentil 95, frente a unos 1,4 s y 2,6 s en un pipeline. Un solo modelo significa un solo salto de red; un pipeline encadena detección de actividad de voz, STT, LLM y TTS, y cada salto añade su propia cola.

¿Puede un agente speech-to-speech llamar a herramientas y seguir un guion?

Llama a herramientas (tu CRM, tu calendario, tus API) en plena llamada. Pero no es determinista: se comporta como con una temperatura fija de 1 y su salida estructurada es limitada. Para guiones que deben decirse tal cual o formularios largos usamos un pipeline, o una capa de voz speech-to-speech que delega el razonamiento y las herramientas en un modelo de texto.

¿Cómo se audita una llamada sin la transcripción de un pipeline?

Cada llamada se graba, se transcribe y se resume a posteriori, y cada llamada se marca y se evalúa según los criterios de éxito que definas, con una alerta tras cada llamada. La revisión es la misma sea cual sea la arquitectura.

¿Qué modelo speech-to-speech suena mejor en francés, español o neerlandés?

Gemini 3.1 Flash Live tiene la mejor voz y la conversación más natural del mercado en todos los idiomas que usamos, francés, español y neerlandés incluidos. En español, Gemini 3.8 Live le sigue de cerca; en francés y neerlandés, las voces de OpenAI y xAI se quedan atrás.

¿Cuesta más el speech-to-speech que un pipeline?

Depende de la llamada. Gemini Live vuelve a facturar el prompt, las herramientas y todo el audio acumulado en cada turno, así que encaja con llamadas cortas con un prompt compacto; Grok Voice factura una tarifa fija de 0,08 $ por minuto; en llamadas largas con prompts pesados, un pipeline suele salir más barato. Compara los tres con tu propio prompt en el simulador de arquitectura.

¿Aún tienes preguntas?

Contáctanos

Contacto

Más funcionalidades

Soporte multilingüe

Agentes de IA en inglés, francés, neerlandés, español y portugués, con voces, mensajes y fechas habladas localizados, y el francés afinado más a fondo.

Call Builder, API, webhooks y skill de Claude

Dibuja el flujo de llamada de tu agente en el Call Builder no-code y luego maneja CallShift desde tu stack o desde Claude: una API REST, herramientas que tus agentes llaman durante la llamada, un webhook de fin de llamada y un skill de Claude.

Siguiente paso

Míralo funcionando con tus propias llamadas.

Reserva una llamada con un ingeniero de voice AI: partimos de tus flujos de llamadas reales y te enseñamos el agente, la arquitectura y las cifras que encajan con ellos.

1:1con un ingeniero de voice AI, sin diapositivas
2arquitecturas que llevamos a producción: speech-to-speech y pipelines
1plan de despliegue para llevarte: volumen, precios, telefonía

~0 % de llamadas perdidas en Bonnie&Car, frente al 55 % anterior. Leer el caso de éxito