BookinglyTech News
Inteligencia artificial

OpenAI lanza la API de agentes y frena suscripciones Pro por carga de sistema

OpenAI ha puesto en beta pública su API para ejecutar agentes autónomos durante días, mientras limita el plan de 200 dólares mensuales por saturación de la infraestructura.

3 min de lecturaThe New Stack0 vistas

OpenAI ha lanzado en beta pública su API de Agentes para permitir que los desarrolladores ejecuten cargas de trabajo autónomas durante días sin supervisión constante, al tiempo que ha pausado las nuevas suscripciones al plan Pro de 200 dólares al mes debido a la saturación de su infraestructura. La API gestiona el seguimiento de tareas largas, la compresión de contexto y el enrutamiento a subagentes en paralelo, eliminando la necesidad de que los equipos de desarrollo construyan y mantengan su propia capa de orquestación para estos flujos de trabajo.

La herramienta aborda un problema operativo clásico: la ventana de contexto finita. Hasta ahora, cuando un agente llegaba al límite, el desarrollo se detenía o la memoria se perdia. La API gestiona ahora automáticamente la compresión del contexto anterior, asegura el acceso a herramientas bajo demanda y orquesta el trabajo entre subagentes paralelos. La ejecución puede correr en el sandbox de OpenAI o en infraestructura controlada por el desarrollador. La arquitectura factura por el uso real de modelos, herramientas y cómputo, lo que simplifica la integración técnica, pero cambia radicalmente la dinámica de consumo de inferencia.

Los datos internos de OpenAI ilustran esa escalabilidad exponencial. Un informe publicado el 6 de septiembre revelaba que, a mediados de agosto, su organización de investigación registraba 3,1 días de trabajo de agentes por cada día humano, medidos en equivalencias de ocho horas. El investigador mediano gastaba más de 600 dólares diarios en inferencia a precios de API; el percentil 90 superaba los 7.000 dólares diarios 1. Antes de junio, los investigadores aún ponían más horas que los agentes; en agosto, la proporción se había invertido tres veces. La barrera técnica para consumir más cómputo se ha disparado al bajar la fricción de gestión.

La presión sobre la infraestructura es inmediata. OpenAI detuvo las inscripciones al plan Pro, argumentando que esa capa de clientes ejerce la mayor tensión sobre sus sistemas. Thibault Sottiaux, lead de ingeniería de Codex, confirmó en X que trabajaban en expandir la capacidad "tan rápido como sea posible". Aunque la API de Agentes y el plan de consumidor son productos distintos, la coincidencia temporal es significativa: la compañía facilita que los equipos ejecuten cargas de trabajo complejas y largas justo cuando la demanda de su modelo más potente, GPT-6 Astra, alcanza el techo de capacidad.

El impacto para el administrador de sistemas o el responsable de arquitectura radica en la previsibilidad. Un solo desarrollador puede generar ahora una demanda de inferencia desproporcionada respecto a su headcount, lanzando múltiples agentes que consultan el modelo continuamente. Controlar el coste ya no depende solo del número de llamadas, sino de la lógica de compresión y enrutamiento interna de la API. La infraestructura de soporte gana peso sobre el propio benchmark del modelo. A medida que más empresas adopten flujos asíncronos, la capacidad de gestionar filas, descartar tokens inútiles y rastrear tareas a largo plazo se convertirá en el costo oculto principal. La promesa de automatización de extremo a extremo se traduce, en la práctica, en una factura de cómputo que escala sin la fricción anterior de tener que programar la orquestación.