Caso de éxito · Desarrollo agentes de voz con IA

Alrededor de un 20 % mejor que su antiguo pipeline.

uMinds gestiona los funnels de venta de más de diez creadores. En una prueba A/B cara a cara en producción real, sus agentes speech-to-speech en español superaron al pipeline Cartesia + GPT-4.1 mini + Deepgram que operaban antes en la métrica que importa: el rendimiento. Misma campaña, una arquitectura cambiada.

uMindsFunnels de venta para creadores · 10+ creadores

  • Gemini 3.1 Flash Live
  • Speech-to-speech
  • SIP a medida a escala
  • Español
01 Resultados

Lo que cambió, en cifras.

~20 %mejor rendimiento que su pipeline orquestado, probado en A/B en producción

Rendimiento en la misma campaña (pipeline = 100)
Pipeline100
Speech-to-speech~120
  • 50.000llamadas completadas en menos de 3 horas
  • 45líneas simultáneas, en producción
  • 5 CPSen un solo número, SIP a medida

Las cifras reflejan la configuración y los resultados de producción de un cliente, no un compromiso contractual.

02 La necesidad

Su punto de partida.

uMinds gestiona los funnels de venta de más de diez creadores, a gran volumen: campañas de decenas de miles de llamadas, con su propia telefonía SIP.

Ya tenían agentes de voz en producción sobre un pipeline orquestado: Deepgram para transcribir, GPT-4.1 mini para razonar y Cartesia para hablar. La pregunta era si el speech-to-speech nativo lo haría mejor en la métrica que importa.

03 Lo que desplegamos

Lo que está en producción.

Prueba
A/B, en producción real, en la misma campaña
Antes
Pipeline: Deepgram (STT) + GPT-4.1 mini (LLM) + Cartesia (TTS)
Después
Speech-to-speech: Gemini 3.1 Flash Live
Idioma
Español
Telefonía
Su propio SIP: 5 llamadas por segundo en un solo número
Concurrencia
45 líneas
Cuentas
3 subcuentas, gestionadas desde un solo lugar
04 Cómo funciona

Misma campaña, una arquitectura cambiada.

  1. Las dos arquitecturas, en producción

    La misma campaña se ejecutó con el pipeline y con speech-to-speech, en producción.

  2. Medido en rendimiento

    El speech-to-speech quedó alrededor de un 20 % por delante del pipeline.

  3. Escalado con el ganador

    Y aguantó en esa misma campaña: 50.000 llamadas completadas en menos de 3 horas, con 45 líneas a 5 llamadas por segundo.

05 En sus palabras

De boca de quienes lo gestionan.

Misma campaña, una arquitectura cambiada

Antes: Cartesia + GPT-4.1 mini + Deepgram, orquestados. Después: Gemini 3.1 Flash Live, speech-to-speech, en su propia telefonía SIP, con 3 subcuentas gestionadas desde un solo lugar.

06 Este caso es para ti si

¿Te reconoces?

  • Hoy operas agentes de voz sobre un pipeline (STT, LLM, TTS).
  • Quieres medir qué cambia el speech-to-speech en tu propia campaña.
  • Necesitas volumen: líneas simultáneas, llamadas por segundo, tu propio SIP.
Siguiente paso

Míralo funcionando con tus propias llamadas.

Reserva una llamada con un ingeniero de voice AI: partimos de tus flujos de llamadas reales y te enseñamos el agente, la arquitectura y las cifras que encajan con ellos.

1:1con un ingeniero de voice AI, sin diapositivas
2arquitecturas que llevamos a producción: speech-to-speech y pipelines
1plan de despliegue para llevarte: volumen, precios, telefonía