IA Aplicada13/09/20266 min lectura

GPT-Live-1: la API de voz con IA que jubila al IVR

Has llamado alguna vez a un servicio de atención al cliente y has querido lanzar el teléfono por la ventana? "Pulse 1 para ventas, pulse 2 para facturación, pulse 47 para hablar con alguien que sienta algo." OpenAI acaba de poner en disponibilidad general GPT-Live-1, una API de voz full-duplex que escucha y habla a la vez, como una persona real al teléfono. Y eso, al menos sobre el papel, debería jubilar al menú de opciones para siempre.

Mascota Marketing Ultra

TL;DR: El resumen sin rodeos

  • Full-duplex de verdad: GPT-Live-1 fusiona escucha, razonamiento y voz en un solo modelo. Nada de encadenar tres sistemas con latencia entre medias.
  • 0,05 $/minuto: coste de la sesión de voz, facturado por segundo. El modelo de razonamiento va aparte.
  • Solo para desarrolladores: no es un plugin ni un botón. Necesitas código, integración y alguien que sepa lo que hace.
  • Europa en el aire: la disponibilidad en España y la UE no está confirmada por OpenAI a fecha de hoy.
Veredicto: salto técnico real en voz con IA, pero entre la API y tu marca hay un valle de desarrollo que no se cruza en una tarde.
En este artículo
  1. ¿Qué es GPT-Live-1 y qué significa full-duplex de verdad?
  2. ¿Qué puede hacer tu marca con GPT-Live-1?
  3. GPT-Live-1 no es para marketers (todavía)
  4. La oportunidad real de GPT-Live-1 para agencias
  5. Preguntas frecuentes sobre GPT-Live-1

Disponibilidad en España/UE: Sin confirmar

La fuente no confirma disponibilidad en España/UE. Fase: disponibilidad general (GA). Elegibilidad: API developers.

¿Qué es GPT-Live-1 y qué significa full-duplex de verdad?

GPT-Live-1 es la nueva API de voz en tiempo real de OpenAI que fusiona en un solo modelo tres etapas que hasta ahora iban por separado: transcripción de voz a texto, razonamiento y síntesis de texto a voz.

Taller de disección: pipeline de 3 piezas con latencia a la izquierda frente a motor unificado GPT-Live-1 con frontera de coste visible abajo

Hasta ahora, montar un agente de voz con IA era un equipo de relevos: uno escucha, le pasa el testigo al que piensa, y este se lo pasa al que habla.

Cada traspaso mete latencia. Y esa latencia es lo que hace que hablar con un bot suene a hablar con un bot.

¿La diferencia? Full-duplex. El modelo puede escuchar mientras habla. Si le interrumpes, para, procesa y sigue sin perder el hilo. Filtra el ruido de fondo. Cambia de tema sin reiniciar. No es un walkie-talkie esperando su turno: es una conversación.

Según los datos publicados por OpenAI, GPT-Live-1 mejora 30 puntos respecto a GPT-Realtime-2.1 cuando se empareja con GPT-6 Astra como modelo de razonamiento a esfuerzo medio. El coste de la sesión de voz: 0,05 dólares por minuto, facturado por segundo. El modelo de razonamiento y las herramientas se cobran aparte.

No parece caro. Pero ojo: el coste real de un agente de voz NUNCA es solo la API.

¿Qué puede hacer tu marca con GPT-Live-1?

La aplicación más directa es jubilar el IVR tal y como lo conocemos. En vez de menús rígidos con opciones numeradas, un diálogo real donde le explicas al sistema lo que necesitas y te entiende. Sin "no he entendido su respuesta". Sin volver a empezar. Esta es la aplicación que más va a notar el usuario final. Y ojo, la que más falta hacía.

Pero hay más. Atención al cliente automatizada con agentes que consultan pedidos, gestionan incidencias y reaccionan a interrupciones sin romperse. Yelp ya está probando Yelp Host para gestionar reservas en restaurantes. Hatch programa reparaciones domésticas con agentes de voz construidos sobre esta misma API.

Y en el terreno interno: asistentes de marca con voz para equipos. Un empleado que captura notas, busca información de producto o gestiona reservas hablando con un sistema que no necesita que deletrees cada palabra. Los desarrolladores controlan el tono y el estilo con el prompt del sistema.

¿Suena bien? Sí. ¿Puedes usarlo mañana? No tan rápido.

GPT-Live-1 no es para marketers (todavía)

GPT-Live-1 es una API para desarrolladores. Punto. No es un plugin, no es un botón en tu CRM, no es una pestaña nueva en ningún panel de control.

Necesitas código, integración con infraestructura de telefonía y alguien que sepa configurar el prompt del sistema para que el agente suene como tu marca y no como un asistente genérico.

La migración desde la Realtime API anterior tampoco es sencilla. No basta con cambiar el nombre del modelo: implica ajustar prompts, herramientas y eliminar el control manual de turnos que antes gestionabas tú. OpenAI ha dejado claro que es un cambio de arquitectura, no un renombrado.

Y el detalle que nos afecta a los que leemos esto desde España: la disponibilidad en la UE no está confirmada por la fuente oficial de OpenAI. La fase es GA (disponibilidad general), pero sin mención explícita a Europa. Si estás planificando algo con esto desde una cuenta europea, verifica directamente antes de dar nada por hecho.

La oportunidad real de GPT-Live-1 para agencias

Apostaría a que el impacto real de GPT-Live-1 va a llegar por los productos que se construyan encima. Las agencias lo notaremos después.

La mascota instala un pequeño módulo API brillante en un único puerto de un enorme panel telefónico vintage con cientos de cables sin conectar

Entre "API disponible" y "producto que un equipo de marketing puede integrar sin un CTO al lado" hay un valle de desarrollo que, en mi experiencia, no se cruza en pocos meses. Así funciona siempre: primero la tecnología, después los productos, y al final los que los usamos.

Lo que sí cambia es la conversación. Hasta ahora, vender un servicio de agente de voz a un cliente implicaba explicar por qué sonaba raro y por qué se perdía con las interrupciones. Esos argumentos acaban de debilitarse.

La tecnología ya no es la excusa. Lo que queda es el trabajo de verdad: diseñar la experiencia e integrar los datos del cliente para que el agente aporte valor.

Los que ya trabajan con agentes de IA aplicados a campañas y marketing tienen ventaja aquí. Llevan tiempo diseñando y probando agentes. Eso es ventaja real.

GPT-Live-1 es un salto técnico real. Los IVR conversacionales van a dejar de ser concepto para ser producto. Pero la parte difícil sigue siendo la de siempre: que eso funcione para tu negocio sin un equipo de ingeniería propio.

El que te venda que lo montas en una tarde, miente.


Preguntas frecuentes sobre GPT-Live-1

¿Cuánto cuesta realmente un minuto de conversación con GPT-Live-1?

La sesión de voz cuesta 0,05 dólares por minuto, facturado por segundo. El coste total incluye además el modelo de razonamiento (como GPT-6 Astra), las llamadas a herramientas que el agente ejecute durante la conversación y la infraestructura de telefonía. En una implementación con volumen alto de llamadas, el minuto real puede salir sensiblemente más caro que la tarifa base de la API.

¿Qué necesita una empresa para integrar GPT-Live-1?

Un equipo de desarrollo con experiencia en APIs de voz, infraestructura de telefonía compatible y capacidad para diseñar el prompt del sistema que define la personalidad y el comportamiento del agente. No existe interfaz visual ni configuración sin código: la integración es 100% programática.

Deja un comentario

Tu correo no se publicará. Revisamos los comentarios antes de mostrarlos.