AllSpark libera Iris-mini e Iris-pro, dos agentes de búsqueda open-weight
El laboratorio chino AllSpark ha publicado dos agentes de búsqueda open-weight, de 35.000 y 397.000 millones de parámetros, con ventana de 256.000 tokens y resultados líderes en su clase, según el equipo.

El laboratorio chino AllSpark ha publicado Iris-mini e Iris-pro, dos agentes de búsqueda open-weight de 35.000 y 397.000 millones de parámetros. Ambos parten de modelos Qwen (Qwen3.6-35B-A3B y Qwen3.5-397B-A17B), usan una ventana de 256.000 tokens y, según el equipo, lideran su clase entre los agentes de búsqueda open-weight. Los pesos están en una colección de Hugging Face y el código en un repositorio de GitHub, junto a un arnés de agente ya disponible.
Tareas construidas al revés
AllSpark genera las preguntas de entrenamiento a partir de la estructura de enlaces de la web. Desde una página semilla y sus enlaces salientes levanta un grafo de términos y relaciones, y de ahí saca una pregunta de varios pasos cuya respuesta exige encadenar nodos. Cada término salvo la respuesta final se sustituye por una paráfrasis, así que no se resuelve con una búsqueda textual simple. Solo entran preguntas que un modelo de referencia no puede contestar sin herramientas pero sí con fuentes adecuadas; eso las mantiene difíciles y verificables.
Un modelo maestro genera caminos con razonamiento, consultas y resultados. Pasan dos filtros: uno revisa la ruta completa en busca de errores, bucles de repetición y profundidad; otro hace una revisión paso a paso con un modelo juez cuyos criterios salen de los propios datos, no de reglas manuales. Luego el modelo se mejora con aprendizaje por refuerzo contra búsqueda web en vivo. El juez y los resúmenes corren dentro del clúster de entrenamiento, con el Qwen grande del equipo, para no depender de servicios externos. Ajuste fino supervisado y refuerzo se alternan en un ciclo que llaman "SFT-RL climbing": las tareas más difíciles y las rutas más eficientes de cada ronda alimentan la siguiente.
Benchmarks y contexto
La evaluación cubre BrowseComp, BrowseComp-ZH, DeepSearchQA y Humanity's Last Exam. Con gestión de contexto activada, Iris-mini obtiene 82,2, 84,8, 86,9 y 52,3; Iris-pro llega a 88,6, 85,1, 92,9 y 56,4. En la clase pequeña, Iris-mini lidera tres de cuatro pruebas y saca 3,4 puntos a XYZ-Aquila-mini en BrowseComp, aunque pierde en DeepSearchQA. Iris-pro lidera o empata en la clase grande y a veces se acerca a sistemas que necesitan mucho más cómputo, según los autores.
El equipo sostiene que la gestión de contexto en ejecución cambia más que las diferencias entre modelos. En sesiones largas el contexto puede llenarse antes de resolver todas las subpreguntas. Trucos como descartar el historial alargan la investigación de forma artificial y dicen poco de la calidad real. Para aislarlo, prueban cada benchmark con y sin gestión, manteniendo fijos herramientas, límites y juez. En el modelo pequeño el efecto es grande: hasta 21,2 puntos en BrowseComp, no por un presupuesto de tokens menor, sino porque consume más rápido y necesita más pasos. En Humanity's Last Exam las ganancias son menores porque pesa más el conocimiento académico. La mejor combinación es descartar historial y hacer un segundo intento: si falla, el sistema condensa lo ya descartado en una nota y la añade a la siguiente pasada.
En el apéndice hay un caso incómodo: una pregunta de BrowseComp-ZH sobre Juego de Tronos marcó como incorrecta la respuesta "Bolton" frente a "Lannister", aunque Sansa Stark se casa con Ramsay Bolton en su segundo matrimonio. El agente acertó. AllSpark dice que estas contradicciones entre verdad de referencia y fuentes les empujan a mejorar los benchmarks. También reportan un efecto lateral: los datos generados y los modelos especializados mejoraron tareas para las que no fueron entrenados, como uso general de herramientas y trabajo de oficina. La hipótesis es que buscar no es una especialidad estrecha, sino una habilidad base para cualquier agente que trabaje con información incompleta.
El lanzamiento incluye Iris Harness, con el bucle del agente, herramientas, estrategias de contexto y los cuatro benchmarks con evaluación. Funciona contra cualquier endpoint compatible con OpenAI. Las tuberías de datos y entrenamiento llegarán más adelante.

