BookinglyTech News
Inteligencia artificial

Alibaba libera OpenCodeReview, un revisor de código con IA que apuesta por el determinismo

La herramienta, en Go y con licencia Apache-2.0, reserva el LLM solo para el análisis y deja la selección de ficheros y las reglas a componentes deterministas. Su recall es el punto discutido.

2 min de lecturaInfoQ0 vistas

Alibaba ha liberado OpenCodeReview, una CLI de revisión de código con IA publicada bajo licencia Apache-2.0. Lo interesante no es el modelo que lleva dentro, sino dónde ha decidido no usarlo.

El proyecto está escrito en Go y reparte el trabajo en etapas con distinto grado de determinismo. La selección de ficheros, el empaquetado del contexto y el matching de reglas los resuelven componentes deterministas; el agente LLM solo entra en el análisis del código. La validación de los comentarios contra el diff también es determinista. Según Alibaba, la herramienta lleva dos años en uso interno por decenas de miles de sus desarrolladores.

Trae comprobaciones para punteros nulos, seguridad de hilos, XSS e inyección SQL. Funciona con modelos compatibles con las API de OpenAI y de Anthropic, revisa diffs de Git, ramas o ficheros completos, y puede ejecutarse en local o integrarse con GitHub, GitLab, Gerrit, VS Code, MCP y agentes de programación como Claude Code, Codex y Cursor.

Un benchmark propio y otro que no salió bien

Alibaba dice que en una prueba interna con 200 pull requests en 10 lenguajes OpenCodeReview logró mejor precisión y mejor F1 que Claude Code gastando alrededor de una novena parte de tokens. La cifra es suya y nadie fuera de la empresa la ha replicado.

Tom Rochette, desarrollador sénior en Shopify, le ha hecho una revisión larga y le concede el mérito de atacar fallos reales de los agentes: cobertura incompleta, desajustes en el número de línea y prompts inestables en changesets grandes. También señala que el proyecto publica su benchmark y reconoce sin disimulo que va por detrás en recall. Su aviso: la única medición independiente que se ha hecho hasta ahora dio alrededor de un 12% de precisión sobre 10 PRs; el mantenedor lo atribuyó a una anomalía en las llamadas a herramientas y lo corrigió, pero nadie ha vuelto a medir después del arreglo.

Daniel Vaughan, responsable de ingeniería en HCLTech, incide en el mismo punto: la mejor configuración llega al 20% de recall, lo que deja sin detectar el 80% de los problemas que marcan los revisores expertos, y el despacho determinista que da precisión también limita el descubrimiento de problemas entre ficheros y de arquitectura. Su conclusión es que el aporte está en el harness, no en el modelo, y cifra la mejora en 2,17 veces la calidad de revisión con una fracción del coste en tokens.

En Hacker News las reacciones se han centrado en la arquitectura más que en los números de Alibaba.

La pregunta que queda es si esa apuesta por la precisión aguanta fuera de los benchmarks de la casa. El techo de recall no es un bug: es el diseño.