BookinglyTech News
Inteligencia artificial

GitHub presenta HydraFusion: orquestación de varios modelos para reducir costes

La nueva función investiga cómo seleccionar el mejor flujo de trabajo entre distintos LLM para equilibrar calidad y gasto computacional.

2 min de lecturaGitHub Blog0 vistas

GitHub ha lanzado Project HydraFusion, una vista previa de investigación dentro de GitHub Copilot que actúa como un orquestador runtime. En lugar de depender de un solo modelo de lenguaje, este sistema evalúa cada solicitud y decide dinámicamente qué combinación de modelos y proveedores utilizar para completar la tarea, buscando un equilibrio entre rendimiento, latencia y coste.

Un enfoque selectivo en tres patrones

La lógica central de HydraFusion es la selectividad. No todos los problemas de código requieren el mismo esfuerzo computacional. Para cada petición, el sistema elige uno de tres patrones de ejecución basándose en señales de capacidad como razonamiento, generación de código y depuración.

El primer patrón es Single, donde un solo modelo resuelve la tarea directamente, priorizando la velocidad. El segundo es Cascade, donde un modelo eficiente redacta una primera propuesta y una puerta de calidad decide si aceptarla o escalarla a un modelo más potente. El tercero es Critique, donde un modelo redacta la solución y un crítico independiente, perteneciente a otra familia de modelos, la revisa antes de que se genere una única revisión final. Este último sigue el mismo patrón de revisión que la herramienta Rubber Duck, pero automatizado.

Para que esto funcione en un entorno de repositorios reales, GitHub ha establecido cinco principios operativos: contabilidad completa de costes en cada etapa, ejecución acotada con timeouts explícitos, revisión aislada sin permisos de escritura, aplicación segura de parches (que evita cambios incompletos si falla la validación) y rutas de enrutamiento verificadas antes de iniciar la ejecución.

Resultados en benchmarks controlados

GitHub ha publicado datos de evaluaciones offline en tres benchmarks de código agéntico: TerminalBench 2.1, DeepSWE y CheckpointBench (este último interno, basado en sesiones reales de Copilot). Los resultados se comparan contra las líneas base de Claude Opus 5 y GPT-5.6 Sol.

En TerminalBench 2.1, HydraFusion mejoró la calidad verificada de las tareas en 4,9 puntos porcentuales mientras reducía el coste estimado en un 67% respecto a Opus 5. En DeepSWE, el ahorro fue del 36% con una pérdida de calidad muy leve (1,5 puntos), y en CheckpointBench, el ahorro del 65% vino acompañado de una variación mínima en calidad (0,1 puntos). La contabilidad de costes incluyó todas las etapas invocadas, como borradores, críticas, revisiones y escalados, ofreciendo una visión realista del gasto.

Lo relevante aquí no es solo la reducción de coste, sino la capacidad de automatizar la complejidad de la orquestación. Los desarrolladores seleccionan HydraFusion como si fuera cualquier otro modelo y el sistema gestiona el routing semántico entre modelos locales, en la nube y compuestos. A medida que lleguen nuevos modelos a la plataforma, podrían incorporarse al pool de opciones de HydraFusion sin cambios por parte del usuario. Es una apuesta clara por la eficiencia operativa en el desarrollo con IA, aunque al ser una vista previa de investigación, su comportamiento en entornos de producción a larga escala sigue por verse.