BookinglyTech News
Inteligencia artificial

Livenerf inicia monitorización diaria del rendimiento de Claude Opus 5.5

El proyecto open‑source Livenerf comienza a medir si el modelo Opus 5.5 de Anthropic pierde precisión o eficiencia tras su lanzamiento.

2 min de lecturaHacker News (top)0 vistas

Livenerf, un benchmark de tipo append‑only, arranca su serie de 30 días para evaluar si Claude Opus 5.5 se degrada después de su publicación el 22 de sep 2026. El objetivo es proporcionar una línea base día 0 y comparar la evolución de precisión y consumo de tokens con métricas estadísticamente robustas.

El repositorio usa la infraestructura de Inspect (inspect.aisi.org.uk) del UK AI Security Institute y sigue la metodología descrita en el paper Adding Error Bars to Evals (arxiv.org/abs/2411.00640). Cada jornada se ejecuta con 90 muestras del panel pre‑registrado (2 336 preguntas de GPQA Diamond, MMLU‑Pro, competition‑math y AIME 2025‑26), usando prompts congelados y una versión fijada del CLI de Claude Code (versión 2.1.280). Los resultados se almacenan en logs crudos para que cualquier cambio futuro pueda reproducirse.

Hasta el 29 de sep 2026 se completaron 6 días de la fase de línea base (días 1‑10). La precisión inicial se sitúa en torno al 93 % en el primer intento, con un 97 % de respuestas consistentes (siempre correctas o siempre erróneas). Un subconjunto de 78 preguntas “a veces correctas” sirve como panel sensible; su tasa de aciertos subió de 54,7 % a 62,0 % en muestras frescas, lo que permite detectar variaciones de alrededor de 7,5 puntos de precisión en una ventana de 10 días.

Además de la exactitud, Livenerf monitoriza el número de tokens de salida como indicador precoz de reducción de esfuerzo computacional. En pruebas de bajo esfuerzo se observó una caída del 62 % en tokens y una pérdida de 8,3 ± 4,5 puntos de precisión; en esfuerzo medio, la caída fue del 26 % en tokens y 4,2 ± 3,9 puntos de precisión. Un cambio de modelo dentro de la misma familia (Opus 5 → Opus 5.5) no fue detectable con la resolución actual (‑3,8 ± 6,3 puntos de precisión, ‑23 % tokens).

Para ejecutar el benchmark se requiere Python 3.11+, uv y una suscripción a Claude Max. El CLI debe quedar bloqueado mediante la variable DISABLE_AUTOUPDATER=1 y el hash de la versión guardado en CLAUDE_CLI_VERSION. Livenerf rechaza ejecuciones si el comando claude --version difiere del hash registrado, garantizando que cualquier actualización del harness se detecte como posible cambio de modelo.

El proyecto publica una tabla de 10 días con la diferencia de puntuación respecto a la línea base y el error estándar asociado. Un delta negativo indica una regresión; un delta positivo señala una mejora. Los resultados se actualizarán diariamente y se discutirán en la sección de Discussions del repositorio.

Este seguimiento es relevante para equipos que dependen de Claude Opus 5.5 en producción, ya que permite detectar de forma temprana cualquier degradación de precisión o eficiencia sin necesidad de crear sus propias métricas de referencia.