BookinglyTech News
Inteligencia artificial

OpenAI abre a los desarrolladores la voz full-duplex de ChatGPT con GPT-Live-1

El modelo de voz full-duplex que hasta ahora solo usaba ChatGPT ya está en la API, con delegación a otro modelo para el trabajo pesado y un precio de 0,05 dólares por minuto.

3 min de lecturaThe New Stack0 vistas

OpenAI ha metido GPT-Live-1 en su API. Es el modelo de voz full-duplex que hasta ahora vivía encerrado en el modo de voz de ChatGPT, y desde esta semana lo puede llamar cualquier desarrollador que quiera montar un agente de voz. La promesa: que el modelo se encargue de la conversación —turnos, interrupciones, silencios— y que el trabajo pesado lo haga otro por detrás.

Una conversación, dos modelos

Un agente de voz montado a la antigua es una cadena. Se transcribe lo que dice el usuario, un LLM decide la respuesta, un motor de texto a voz la lee en alto. Cada salto añade latencia y rigidez, y de ahí sale ese aire de contestador automático que tienen casi todos. GPT-Live-1 se queda con la primera parte y delega el resto. Cuando una petición necesita razonamiento de varios pasos o llamadas a herramientas, el modelo de voz la manda a un backend —GPT-6 Astra, uno más pequeño como Luna o algo de otro proveedor— y sigue hablando mientras espera, rellenando el hueco en lugar de dejar al usuario en silencio.

La delegación se expone con una interfaz dirigida por eventos. La sesión de voz genera un delegation_id, envía el contexto al sistema que va a hacer el trabajo y recoge el resultado en un evento llamado session.commentary.append. El modelo integra esa respuesta en la conversación en vez de leerla como un bloque. En la documentación de la API está el patrón completo, con un ejemplo que usa el SDK de Codex.

OpenAI dice que GPT-Live-1 rinde 30 puntos porcentuales por encima de GPT-Realtime-2.1 en Full Duplex Bench. Emparejado con GPT-6 Astra en razonamiento medio, se pone primero en el τ³-benchmark. Son cifras de la casa, no de un tercero.

Lo que cuesta y lo que se cede

El modelo de voz sale a 0,05 dólares por minuto, unos 3 dólares la hora. A eso hay que sumar cada llamada al modelo de razonamiento que tenga detrás: cuanto más consulte el agente al backend, más sube la factura. La contrapartida es que ahora se puede elegir dónde gastar. Agendar una cita puede resolverse con Luna; una pregunta que necesita herramientas y varios pasos se va a Astra.

El otro precio es el control. Con el enfoque en cascada cada pieza se podía cambiar por la de otro proveedor. Aquí OpenAI se queda con más trozo de la conversación, y GPT-Live-1 define cómo se habla con el resto del sistema. Hay clientes tempranos dispuestos a pagarlo: Tony Stoyanov, cofundador y CTO de EliseAI, dice que tras el cambio borró 23.000 líneas de código y su base se redujo un 80%. Speak, que enseña idiomas, vio que el modelo interrumpía casi un 80% menos a quien se quedaba pensando la respuesta. Yelp ya lo usa en Yelp Host y Hatch, y su CTO, Alex Levy, afirma que más llamadas se cierran sin intervención humana.

Queda por ver si la mejora en la conversación compensa la dependencia de un solo proveedor para la capa que el usuario escucha. Llevamos años con agentes de voz que suenan a máquina; el argumento de OpenAI es que la única forma de arreglarlo pasa por dejar de trocear el problema en cuatro servicios.