Stanford convierte artículos científicos en agentes de IA con su framework Paper2Agent
El sistema open source transforma manuscritos y código en servidores MCP que permiten a los agentes reproducir análisis y aplicar métodos a nuevos datos.
Un equipo de Stanford ha publicado en Nature el framework Paper2Agent, una herramienta open source que convierte artículos científicos en agentes de IA activos. El objetivo no es simplemente resumir el texto, sino permitir que un agente llene el rol de "autor virtual" capaz de reproducir análisis, ejecutar código y aplicar los métodos descritos en el paper a conjuntos de datos nuevos.
Arquitectura basada en MCP
La clave técnica reside en el uso del Modelo de Protocolo de Contexto (MCP). El workflow de Paper2Agent toma el manuscrito, los materiales suplementarios, el repositorio de código y los datasets para generar un servidor MCP. Este servidor expone las herramientas, recursos y flujos de trabajo de la investigación. Un agente LLM se conecta a este servidor mediante peticiones en lenguaje natural y puede, de forma autónoma, ejecutar demostraciones o validar resultados contra las figuras del artículo original.
James Zou, profesor de ciencias de la computación en Stanford, explica que dar acceso directo a un LLM sin esta estructura es impredecible. Su equipo buscaba evitar que el modelo solo "leyera" el paper, sino que interactuara con sus componentes ejecutables. Zou aclara que el servidor MCP puede alojarse localmente para proteger información sensible, aunque advierte que cualquier dato procesado por el agente terminará siendo enviado al backend de LLM elegido. Por tanto, si se maneja información protegida, debe excluirse explícitamente del flujo.
Para mitigar alucinaciones, el sistema valida cada herramienta contra los resultados y figuras del paper y las "bloquea" para asegurar la reproducibilidad. Aun así, los autores insisten en que Paper2Agent es una herramienta de aumento, no una fuente autoritativa; los investigadores deben verificar cualquier salida generada.
Resultados en pruebas de escala
El equipo evaluó el sistema con 136 artículos, incluyendo 100 de biología computacional. En ese subconjunto, 74 papers se convirtieron exitosamente en agentes. Los fallos se debieron principalmente a repositorios incompletos, documentación ausente o configuraciones de entorno irresolubles, un problema habitual en la reproducibilidad científica.
El código está disponible en el repositorio de GitHub y existe una versión en línea que permite probar el sistema ingiriendo otros artículos. El equipo planea desarrollar una plataforma donde estos agentes colaboren entre sí para abordar nuevos problemas de investigación.


