BookinglyTech News
Inteligencia artificial

Cuatro agentes cuestan 2,115 veces más que dos y no mejoran el resultado

Un experimento preregistrado con seis ejecuciones compara dos y cuatro agentes sobre una tarea determinista: ambos grupos aciertan uno de cada tres intentos, pero el cuarteto dobla el gasto.

3 min de lecturaDev.to0 vistas

Un experimento preregistrado ha comparado dos configuraciones del mismo sistema multiagente sobre una tarea determinista: dos agentes con tres pasos frente a cuatro agentes con cinco. Seis ejecuciones en vivo, tres por grupo, todas cerradas dentro de los límites fijados. Cada grupo acertó exactamente una de cada tres veces. El de cuatro costó 2,115 veces más por ejecución y por éxito completo. La lectura del autor es que más agentes no son automáticamente mejores: eran viables de operar, pero en esta tarea no aportaron nada.

Cómo estaba montado

La tarea es sintética y decidible por máquina. Ocho participantes con nombre, cada uno elige cuántas unidades de reparación aporta, y el conjunto solo se da por bueno si el total alcanza un umbral fijo. La cobertura está forzada, así que todos los agentes seleccionados actúan. No hay razonamiento del modelo para la elección: devuelve un JSON estricto. El objetivo de forzar la cobertura era evitar el fallo que el autor ya había visto antes, donde un agente acaparaba todos los turnos y los demás no llegaban a intervenir.

El modelo es deepseek-flash sobre un contrato de Responses API. Los topes por ejecución: 150 llamadas, 0,50 dólares y 600 segundos. Las seis pasaron todos los controles de validez previstos, que cubren procedencia, cobertura, elecciones enteras, aritmética, respeto de los límites, cierre de puertos y hashes de los archivos. Ni un fallo de parser, ni un presupuesto reventado, ni un puerto abierto de más.

Los agregados por grupo quedaron así:

Métrica 2 agentes 4 agentes Ratio
Éxitos completos 1 / 3 1 / 3 1,000
Llamadas medias 17,00 33,00 1,941
Tokens medios 10.461,67 21.877,00 2,091
Coste medio (USD) 0,028798 0,060906 2,115
Contribuyentes a cero (media) 1,000 1,333 1,333

El grupo de cuatro sí logró un éxito completo, así que el mecanismo no está roto. Simplemente no compensa pagar el doble por él en este escenario, y además deja más participantes sin aportar nada de media.

Qué no demuestra

No demuestra que cuatro agentes sean peores en general, ni se traslada a otra tarea o a un usuario real. Tampoco dice nada sobre la calidad de los agentes con revisión humana, porque ninguna persona puntuó estas ejecuciones. Son tres repeticiones por grupo sobre una única tarea sintética.

El autor ha publicado dos piezas: el paquete del método, con licencia MIT en el commit 6cc70156facb37baf23fe5fe57dad93d43502b91, que incluye esquema, adaptador sintético, fixtures y pruebas; y la capa de confianza, también MIT, en la release v0.1.0-rc2, que valida ejecuciones en local, genera informes con hash y trae una prueba de borrado sintética. El protocolo completo y las ejecuciones archivadas siguen privados.

Para quien quiera reproducirlo, la guía de la capa de confianza espera 13 pruebas superadas tanto con TZ=UTC como con TZ=Asia/Shanghai, un report_hash a841b192981fd7e7 y un audit_hash de borrado 4f0193abbd49a0f9. Si algún hash sale distinto, el autor pide que se lo cuenten: dice que es la respuesta más útil que puede recibir, y busca tres reproducciones independientes hechas por gente ajena al proyecto.