c010rNews
Inteligencia artificial

FrontierHarness v1.0 publica métricas de coste y rendimiento para 9 harness de IA

La nueva versión muestra que el gasto por ejecución puede variar hasta 17 veces entre los harness evaluados.

2 min de lecturaShow HN0 vistas

FrontierHarness ha lanzado la versión 1.0, que incluye una tabla comparativa de nueve harness de IA ejecutados sobre el entorno Runta. La métrica clave es el coste medio por tarea exitosa, que oscila entre 0,19 $ y 3,24 $, una diferencia de 17 × entre el harness más barato y el más caro.

Los datos se obtienen de 15 pasadas sin contar los fallos; si se incluyen los intentos fallidos, el coste medio sube a 3,24 $ por tarea. El informe también muestra la tasa de aciertos en caché, el tiempo medio por tarea exitosa y la proporción de coste frente a calidad. Por ejemplo, el harness Claude Code completa 19 tareas pero genera un gasto de 18,34 $ por tarea, mientras que otros como OpenCode mantienen costes bajo 1 $ con tasas de aciertos en caché similares.

Los harness evaluados son: Codex v0.148.0, DeepSeek v0.1.0‑rc.8, Claude Code v2.1.237, Pi v0.84.2, Oh My Pi v17.4.0, Kimi Code v0.37.2, Exo Harness v0.1.0, OpenCode v1.18.19, Hermes v0.20.4 y el propio FrontierHarness v1.0. Cada ejecución se realiza en un checkpoint idéntico: mismo número de vCPU, memoria, disco y estado en memoria, garantizando que las diferencias provienen del harness y no del entorno.

FrontierHarness invita a los usuarios a probar sus propios harness en Runta ofreciendo 100 $ en créditos de prueba. La iniciativa busca ampliar la comparativa y afinar los modelos de coste‑rendimiento para tareas de ingeniería de software y entornos de terminal.

En la práctica, estos números son útiles para equipos que automatizan flujos de trabajo con LLMs. Un harness con bajo coste pero alta tasa de aciertos en caché puede reducir significativamente la factura en entornos de CI/CD donde se ejecutan miles de pruebas por día. Por otro lado, la divergencia entre calidad y coste, como la observada en Claude Code, obliga a sopesar la precisión contra el presupuesto.

Queda por ver cómo evolucionarán estas métricas cuando se añadan más harness y se amplíe el conjunto de tareas más allá de la ingeniería de software. La comunidad deberá validar si los resultados se mantienen en dominios como análisis de datos o generación de contenido, donde los patrones de uso pueden ser diferentes.

Relacionado

FrontierHarness v1.0 muestra costos y rendimiento de 9 harness de IA · c010r News