Armature analiza por qué los agentes de código eligen herramientas específicas
Un estudio revela que el contexto del repositorio y las preferencias de cada modelo condicionan la selección de software por parte de la IA.

Armature ha publicado los resultados de un análisis experimental sobre cómo los agentes de codificación seleccionan herramientas de terceros. La empresa, que desarrolla servicios de crecimiento para herramientas de desarrolladores, afirma que los vendedores de software ven congelados veinte años de construcción de marca. Los agentes no solo recomiendan; deciden qué se integra en el código base, un cambio que Theodore Otzenberger, cofundador de Armature, describe como vital para la supervivencia de estos productos en la pila tecnológica actual.
El equipo estudió sesiones de elección de herramientas utilizando tres agentes: Claude Code, Codex y Cursor. La muestra final validada constaba de 5.292 sesiones, extraídas de 75 repositorios públicos en GitHub. Para evitar sesgos, utilizaron nombres ficticios, historiales de Git artificiales y claves de API falsas. Un orquestador simuló la intervención humana, aceptando siempre la primera solución o pidiendo al agente que eligiera la mejor opción. Otzenberger señala que sin esta capa de «humano en el bucle», los agentes tendían a construir soluciones in-house por falta de autorización para instalar dependencias externas.
El hallazgo principal es que el contexto del repositorio determina la herramienta ganadora. En pruebas para servicios de correo electrónico, TypeScript favoreció a Resend en el 55% de los ejecuciones, mientras que Python eligió SendGrid, Go prefirió Postmark y Java optó por Azure Active Directory Communication Services. Esto indica que el lenguaje de programación y el ecosistema previo pesan más que la reputación general de la marca.
También detectaron diferencias claras en las fuentes de información de cada agente. Cursor consulta la web en dos tercios de las sesiones. Codex lo hace en el 94%, usando operadores de búsqueda específicos como site: en el 90% de los casos. Claude Code se apoya principalmente en sus conocimientos previos y solo busca en internet en un 30% de las ocasiones, aunque cuando lo hace, revisa tres veces más páginas que Codex. Solo en el 42% de los casos los tres agentes seleccionaron la misma herramienta.
Otzenberger advierte que la reputación de un producto queda atada a lo que lo hizo famoso, pero opera bajo una gravedad distinta hoy. Si un agente recuerda a Docker por los contenedores pero no reconoce sus sandbox actuales, puede finalizar la tarea sin elegirlo. Los vendedores deben asegurar que sus herramientas sean mencionadas y elegidas por los agentes, o simplemente dejarán de existir en las pilas de tecnología de sus clientes. Armature ha abierto toda la investigación en su blog para que cualquier persona pueda verificar los datos, y planea rerunear el estudio con nuevos modelos como Astra y Fable 5.1.

