BookinglyTech News
Inteligencia artificial

Pac-Bench mide qué modelos clavan un Pac-Man completo de un solo intento

El proyecto, alojado en GitHub, enfrenta a varios modelos a la tarea de escribir un Pac-Man jugable a la primera y documenta el coste y los tokens de cada intento.

2 min de lecturaShow HN0 vistas

Un desarrollador ha publicado Pac-Bench, un banco de pruebas que mide qué modelos de lenguaje son capaces de sacar un Pac-Man jugable de un solo intento. Cada entrada es un archivo HTML que se ejecuta tal cual, y la web compara el resultado modelo a modelo junto al coste y los tokens que consumió el intento.

Las reglas están detalladas en el repositorio. Las entradas se agrupan por fases y no todas salieron del mismo sitio. Las de la fase 2 se generaron con Claude Code apuntando a OpenRouter; las de la fase 3, con Antigravity y Gemini. La tarjeta de Grok Bot salió dentro del propio chat, con el mismo prompt corto que el resto y sin mirar antes lo que habían hecho los otros modelos. Las de gpt-6 Codex son repeticiones lanzadas por API.

Cómo se cuenta el gasto

El coste de esas repeticiones no es una estimación a ojo: se aplica la tarifa estándar que OpenAI tiene publicada al consumo de respuesta que quedó capturado. Donde la ejecución pasó por Cursor Cloud y hay dato, se usa la suma de chargedCents del panel. Las etiquetas de modelo son el nombre corto, sin prefijo de proveedor, fecha ni sufijo de esfuerzo; los identificadores completos, tanto el solicitado como el real, quedan bajo los datos de la ejecución. Si dos tarjetas comparten etiqueta, la que se pidió a un modelo distinto lo avisa bajo el título.

Las estadísticas son tiempo de reloj y conteo de tokens sacados de las transcripciones del harness cuando existen. El tamaño del HTML es el del archivo servido. Un guion significa que esa ejecución no registró el número.

Un test de un solo disparo sobre un único archivo es una forma barata de comprobar si un modelo produce código que arranca sin que nadie le corrija nada, que es justo lo que se le pide en las herramientas agénticas. También es un test estrecho: un Pac-Man en un HTML no dice nada sobre cómo se porta el modelo en un repositorio con dependencias, tests y revisiones de código. Queda por ver si la tabla aguanta ese escrutinio.