OpenAI publica GPT-Live-1 API para interacción de voz full-duplex
La nueva versión permite hablar y escuchar simultáneamente con una latencia de turno de 0,8 segundos. El modelo no está incluido en el plan gratuito.

OpenAI ha habilitado la API de GPT-Live-1 para desarrolladores, compartiendo la misma infraestructura que ya corre en el cliente de ChatGPT. El modelo introduce comunicación full-duplex, es decir, capacidad de escuchar y responder al mismo tiempo sin atender por turnos rígidos. La compañía permite emparejar esta capa de voz con distintos modelos de backend, ajustando la profundidad de razonamiento, la velocidad de respuesta y el coste según el caso de uso.
El precio se sitúa en 0,05 dólares por minuto de audio. No es barato. Quien integre esta funcionalidad tendrá que tener claros los márgenes de su aplicación para que la operación sea sostenible. OpenAI ha acompañado el lanzamiento con datos de rendimiento que muestran mejoras cuantificables sobre GPT-Realtime-2.1. En pruebas de interactividad full-duplex, GPT-Live-1 alcanza el 80,1 por ciento, frente al 45,4 por ciento del modelo anterior. La latencia en el cambio de turno baja a 0,8 segundos, reducida desde los 1,4 segundos previos. La precisión en las llamadas a herramientas sube hasta el 87 por ciento, comparado con el 60 por ciento. Además, en un benchmark de soporte bancario por voz, el modelo consigue una tasa de aprobado del 32 por ciento, muy por encima del 12,4 por ciento de la generación pasada.
Integración y capacidades técnicas
GPT-Live-1 incluye doce nuevas voces con distintos acentos, dialectos e idiomas. La API devuelve transcripciones ASR y texto de respuesta de serie, lo que facilita la auditoría o el procesamiento posterior de la conversación. Yelp ya está utilizando el modelo para reservas telefónicas. Según Alex Levy, CTO de la plataforma, esto ha mejorado la gestión de las llamadas entrantes. OpenAI no especifica el tamaño del despliegue ni los detalles de infraestructura que soportan a Yelp, pero el caso práctico indica que el modelo ya maneja flujos de trabajo reales más allá de demos controladas.
Para los que necesiten integrar esto en su stack, la documentación de la API describe los endpoints y los modelos compatibles. Los desarrolladores tienen que decidir si el costo por minuto merece la pena para su volumen de tráfico. En entornos de alta concurrencia o con conversaciones largas, el gasto se acumula rápido. La decisión técnica girará en torno a si la reducción de latencia y la precisión en las herramientas justifican la inversión frente a soluciones alternativas o modelos propietarios propios.


