OnPoint impone a los agentes de código un formato de respuesta para gastar menos tokens
El paquete, con licencia MIT, se instala sobre una docena larga de agentes de programación y les obliga a responder con la idea grande, la siguiente acción y pocas palabras. Su autor mide un 23% menos de tokens en sesiones largas.

Un desarrollador llamado Junchen Pan ha publicado OnPoint, un paquete de instrucciones que se instala sobre agentes de programación y les impone un mismo formato de salida: primero la idea grande, después la siguiente acción, y menos prosa alrededor. La lista de destinatarios pasa de doce herramientas, entre ellas Claude Code, Cursor y Codex. El repositorio está en HuskyDanny/OnPoint y sale con licencia MIT.
No es un agente nuevo
Conviene aclarar qué es esto y qué no. OnPoint no sustituye al agente ni trae un modelo propio: es una capa de instrucciones que se añade a la pila que el usuario ya tiene montada. En Claude Code se instala con un comando:
npx skills add HuskyDanny/OnPoint
Para el resto de herramientas que cubre, el autor propone apuntar el agente a los ficheros de habilidad que hay en el repositorio. El mecanismo es el mismo en todos los casos: el agente recibe una convención de estilo y la aplica a sus respuestas.
El problema que dice atacar es conocido por cualquiera que haya trabajado con estos asistentes en sesiones largas. El modelo entierra el paso útil debajo de párrafos de relleno, y cada uno de esos párrafos se paga en tokens y se queda en la ventana de contexto, desplazando lo que de verdad importa. En un ciclo de trabajo de horas, el ruido se acumula.
El dato es del autor
La cifra que sostiene la propuesta es un 23% menos de tokens en ejecuciones de horizonte largo. Es una medición propia, sin banco de pruebas publicado, sin metodología y sin que nadie externo la haya replicado. El repositorio no incluye una demo ni comparativas de calidad: no se sabe si el agente acierta igual cuando responde menos, ni en qué tareas se hizo la medición.
Que la cifra sea verosímil no la convierte en verificada. Quien quiera comprobarla tendrá que montar su propio experimento, y para eso lo razonable es medir el consumo antes y después sobre las mismas tareas, no fiarse del número de la portada.
Lo que sí se puede evaluar hoy sin demasiado esfuerzo es el coste de probarlo: es un comando, el código es abierto y la licencia permite modificarlo. Si la convención no encaja, se desinstala y ya está. El interés real está en el enfoque, porque ataca un problema de operación y no de modelo: los tokens no son gratis y el contexto es finito, así que cualquier cosa que reduzca el ruido en las respuestas largas tiene recorrido, se llame OnPoint o se llame de otra forma.

