Raven, un orquestador de agentes que reescribe su propio harness
EverMind AI publica en GitHub un harness pre-alpha que genera DAGs y coordina agentes especializados, con un Curator que reescribe su memoria, su planificación y sus herramientas.
Raven es un harness de harnesses: un orquestador que genera DAGs y reparte trabajo entre varios agentes especializados. Lo ha publicado EverMind AI en GitHub y está en fase pre-alpha, así que sus interfaces y su configuración pueden cambiar sin aviso. La idea de fondo no es solo coordinar agentes, sino que el sistema proponga cambios en cómo planifican y actúan, los evalúe y se quede con los que pasan la validación.
El proyecto se apoya en EverOS para arrastrar memoria y contexto entre sesiones, y trae cuatro agentes de serie: Raven-Research para investigación y revisión de literatura, Raven-Code para desarrollo con tests, Raven-Design para generar presentaciones, gráficos e interfaces, y Raven-Oncall para automatizar flujos sin supervisión durante horas o toda la noche. Se pueden usar sueltos o encadenados en un mismo flujo de trabajo.
Cómo se modifica a sí mismo
El mecanismo interesante es el Curator. El bucle del agente está partido en cuatro módulos desacoplados: Memory (qué ve el agente en cada turno), Planning (cómo aborda el trabajo), Capability (qué herramientas expone cada iteración) y Action (qué hace y cómo lo juzga antes de ejecutarlo). El Curator reescribe esos cuatro asientos, y no solo el prompt: también puede sustituir las herramientas y los servicios externos a los que llama, los procedimientos que sigue y su propio criterio en cada punto. Cada cambio afecta solo a ese agente y, una vez instalado, el agente funciona sobre él. Aparte, Raven Evolver consume Raven como librería y evalúa candidatos contra benchmarks; desarrolla a los agentes, no corre dentro de ellos.
Los números que acompañan al anuncio son suyos y no los ha verificado nadie. En un proyecto de juego con Godot 4, Raven trabajó de forma autónoma unos cuatro días, con 42 rondas de planificación, desarrollo y verificación, y entregó el juego —hay una web del proyecto—, el póster, la presentación y el sitio web. En experimentos de preentrenamiento con nanochat hizo 172 entrenamientos repartidos en 7 rondas sin una sola caída, con una reducción del 5,8% en val_bpb dentro del mismo presupuesto de 20 minutos en una sola GPU; los resultados y las visualizaciones están en la web del proyecto. También afirma haber recortado el overshoot de una simulación de rotura de presa en tres órdenes de magnitud. Raven-Oncall, dicen, supera a Claude Code en calidad y coste para tareas de AI4AI.
Qué mirar
Que el propio repositorio se llame "harness de harnesses" y prometa rendimiento SOTA en cuatro dominios a la vez invita a desconfiar: pre-alpha, benchmarks propios y ninguna demo reproducible fuera de sus páginas. Aun así, la arquitectura del Curator merece un rato. Separar memoria, planificación, capacidades y acción en piezas sustituibles, y dejar que un proceso externo las evalúe contra métricas, es un diseño que se puede copiar aunque Raven no llegue a nada.

