OpenAI pone GPT-Live-1, su modelo de voz full-duplex, a disposicion de los desarrolladores
La API permite interacciones de voz fluidas y simultaneas. OpenAI cobra 0,05 dolares por minuto mas el coste del modelo backend.
OpenAI ha publicado oficialmente el acceso a GPT-Live-1 mediante una API publica. El modelo, que se estreno de forma limitada en julio a traves de la interfaz de ChatGPT, pasa ahora a ser un componente mas para que los equipos de desarrollo integren conversaciones por voz en tiempo real dentro de sus aplicaciones empresariales y flujos de trabajo.
La caracteristica tecnica principal es la operacion en full-duplex. A diferencia de los sistemas tradicionales de voz por IA, que funcionan en half-duplex (el modelo habla hasta terminar antes de escuchar, o exige silencios absolutos para detectar el final de la frase), GPT-Live-1 puede procesar la entrada de audio y generar salida de voz de forma simultanea. Esto permite a los usuarios interrumpir al modelo, corregir instrucciones sobre la marcha o cambiar de tema sin esperar a que termine un bloque de audio pregenerado. Para un desarrollador que construya un assistente virtual, la diferencia es similar a pasar de una radio walkie-talkie a una llamada telefonica normal.
OpenAI estructura la arquitectura en dos capas. GPT-Live-1 se encarga exclusivamente de la capa de percepcion e interaccion: sintetizar la voz, reconocer el habla y gestionar las interrupciones. La logica, la busqueda de informacion y la ejecucion de herramientas quedan relegadas a un modelo backend, como GPT-6 Astra u otras opciones mas economicas para tareas repetitivas. Esta separacion permite escalar el procesamiento de voz sin sobrecargar el modelo de razonamiento principal.
Los datos de rendimiento que publica la empresa comparan a GPT-Live-1 con sus predecesores. En el benchmark Tau3, que evalua tareas de servicio al cliente para sectores como aerolineas y telecomunicaciones, el nuevo modelo alcanza una puntuacion del 86,2 %. Sus antecesores, GPT-Realtime-2.1 y GPT-Realtime-2, se quedaban en el 45,7 % y el 42,4 %, respectivamente. OpenAI tambien asegura que la latencia en la gestion de turnos ha mejorado significativamente y que el comportamiento interactivo es superior en un 30 % frente a la version 2.1.
Yelp es uno de los primeros casos de uso publicos. La compania utiliza el modelo en su servicio Yelp Host para gestionar reservas telefonicas en restaurantes. Akhil Kuduvalli Ramesh, director de producto de Yelp, afirma que la tecnologia permite experiencias mas conversacionales y reduce la carga del personal humano, aunque la nota original no aclara si los clientes prefieren esta fluidez automatica o la soportan por conveniencia.
El coste de operacion es de 0,05 dolares por minuto de uso de la capa de voz, ademas del coste del token del modelo backend que se este ejecutando. Las voces personalizadas requieren negociacion directa con el equipo de ventas empresarial. El servicio tambien esta disponible a traves de OpenAI Presence, la plataforma de agentes para empresas.
Implcaciones para el desarrollo
La disponibilidad de esta API cambia la curva de aprendizaje para construir agentes de voz complejos. Hasta ahora, gestionar interrupciones (interjections) y el estado de la conversacion en tiempo real implicaba una logica de estado lateral considerable en el lado del cliente o del servidor proxy. Al delegar esta complejidad en el modelo de inference de OpenAI, los desarrolladores pueden enfocarse en la orquestacion de herramientas y la calidad de la respuesta semantica. La pregunta pendiente es como se comportara la latencia percibida cuando miles de peticiones concurrentes golpeen los endpoints de inference, y si la separation de capas introduce cuellos de botella en la sincronizacion entre la voz y la logica de negocio.


