BookinglyTech News
Inteligencia artificial

OpenAI baja a la mitad el precio de los tokens de GPT-6 y aprieta el caché

Sol y Luna llegan con recortes de precio del 50% frente a GPT-5.6 y con más aciertos de caché por defecto, además de un panel para ver qué contexto se reutiliza.

3 min de lecturaThe New Stack0 vistas

OpenAI ha publicado GPT-6 Sol y Luna, dos modelos que se quedan por debajo del buque insignia Astra en alineación, pero que llegan con una rebaja fuerte en el precio de los tokens. La compañía ha recortado las tarifas de la API a la mitad respecto a sus equivalentes GPT-5.6, y en el caso de los tokens de salida de Luna el descuento llega al 58%. A eso suma mejoras de caché que, según la propia OpenAI, reducen aún más la factura de quien mueva agentes.

Los precios quedan así por millón de tokens: Sol pasa a 2 dólares de entrada y 10 de salida, frente a los 4 y 20 de GPT-5.6 Sol, que la compañía marca como tarifa promocional. Luna baja a 0,10 dólares de entrada y 0,50 de salida, desde los 0,20 y 1,20 anteriores. Son cifras de OpenAI, no de un tercero, y se aplican solo al consumo vía API.

El caché como palanca

Prompte caching no es nuevo, pero sí lo es que los aciertos lleguen por defecto en mayor proporción. OpenAI mantiene el descuento del 90% sobre los tokens de entrada leídos desde caché, el mismo que ya aplicaba a GPT-5.6. Lo que cambia es la frecuencia con la que ese caché se acierta, y ahí está el ahorro real: si el modelo reutiliza contexto ya procesado, no vuelve a pagar por él ni a esperar a que se recalcule.

El segundo cambio es de operación. Sol y Luna permiten ajustar el esfuerzo de razonamiento y la disponibilidad de herramientas sin romper el caché. Es decir, un agente puede subir o bajar el esfuerzo según la dificultad del paso que tenga delante, o habilitar unas herramientas u otras según la tarea, y conservar intacto el contexto anterior. Antes, esos cambios obligaban a reprocesar desde cero.

A esto se añade un Prompt Caching Dashboard donde se ve cuánta entrada está en caché y cómo evoluciona esa cantidad en el tiempo. La herramienta marca las ocasiones en las que el caché se ha fallado, para que el desarrollador sepa qué parte de su prompt no está aprovechando la reutilización. La idea es sacar esa métrica de la trastienda y ponerla delante de quien paga la factura.

OpenAI dice que estas mejoras ya se notan. Cita a GitHub: según la compañía, la proporción de tokens de prompt que necesitan procesarse de nuevo ha caído más del 50% en miles de millones de peticiones repartidas en los últimos meses. Es un dato que GitHub da a OpenAI, y OpenAI lo publica.

Qué implica operarlo

Para quien diseña agentes con tareas largas, el mensaje es que el coste ya no se ataca solo comprando un modelo más barato. Bajar la tarifa de los tokens frescos y reducir cuántas veces se reprocesa el mismo contexto son dos palancas distintas, y conviene medir las dos por separado antes de dar por buena una migración. El panel de caché ayuda a hacerlo, aunque no sirve de nada si el prompt cambia de estructura en cada llamada.

Queda por ver cómo se comportan Sol y Luna en tareas donde el contexto se toca constantemente y el caché no puede sostenerse. Ahí el recorte de precio se queda en lo que es: un recorte de precio.