BookinglyTech News
Inteligencia artificial

Un rastreador vigila qué productos recomienda cada modelo de IA de frontera

Latent Space ha lanzado un observatorio que analiza las respuestas de siete modelos en 161 categorías y desvela sesgos y sorpresas.

3 min de lecturaLatent Space0 vistas

Si trabajas con modelos de lenguaje o te dedicas a hacer que tu producto aparezca en sus recomendaciones, esto te interesa. Latent Space ha publicado el Frontier AEO Tracker, una herramienta que somete a siete modelos de frontera a 161 categorías de productos y servicios, desde agentes de código hasta software de nóminas, y resume qué recomienda cada uno y por qué.

El proyecto amplía la metodología que AmplifyingAI usó en su estudio sobre Claude Code, pero con seis variantes de prompt por categoría. Los modelos incluidos son los grandes nombres: los de Anthropic (Opus y Fable), los de OpenAI (Sol y Astra), además de Grok, Muse y SWE-1.7. La extracción de respuestas la hace Astra, y se asigna una puntuación que pondera la primera elección, las alternativas y las menciones, pero también penaliza las recomendaciones negativas, algo poco frecuente.

Los resultados están disponibles en el sitio del rastreador, con cada par de prompt y respuesta inspeccionable, así que puedes comprobar si hay contaminación o sesgos. Y los hay, y algunos son obvios: los modelos tienden a recomendar productos de su propia casa. Fable y Opus prefieren Claude Code, Astra y Sol se decantan por Codex, Grok menciona a Cursor, Muse recomienda Muse Code y SWE-1.7 apuesta por Devin. Eso sí, también hay casos loables de modelos de OpenAI que sugieren Claude, lo que sugiere que no todo es parcialidad.

El tracker revela además 28 categorías (de 161) donde todos los modelos coinciden en la misma opción principal, mientras que el resto son disputas cerradas. Y eso tiene consecuencias para quien invierte en optimización para motores de IA (AEO).

Una de las observaciones más interesantes surge al comparar generaciones de modelos de un mismo laboratorio. En la transición de Opus a Fable, y de Sol a Astra, Latent Space ha visto cambios muy relevantes en las recomendaciones, y han preparado informes específicos para esos casos. También han detectado que Anthropic está sesgando a sus modelos para que consulten más fuentes: Fable usa una mediana de 15 fuentes frente a las 11 de Opus. Astra, en cambio, es más eficiente: solo 5 fuentes de mediana, y además cambia menos de opinión cuando se reformula ligeramente la pregunta. Eso eleva el valor del propio AEO: si la aleatoriedad disminuye, lo que hagas para aparecer en las respuestas pesa más.

El análisis de fuentes también apunta a lo que los laboratorios priorizan en sus datos y en su entrenamiento, aunque la muestra es pequeña y solo captura lo que se puede extraer de las llamadas a herramientas, no el conjunto de pretrain. Lo que sí validan es que prácticas de AEO como la negociación de contenido en markdown, que defienden desde Vercel y Ora, son reales y que los fracasos disuaden a los modelos de leer tu contenido.

El proyecto es un primer paso, y sus propios autores reconocen que no han podido incluir a Gemini, GLM o DeepSeek por errores y límites de tasa. Pero ya hay algo para rascar, sobre todo si te preguntas por qué tu producto no sale en las respuestas de estos asistentes.