BookinglyTech News
Inteligencia artificial

Los modelos abiertos chinos se quedan a cuatro meses de la frontera de EE. UU.

Mozilla sitúa la brecha entre modelos abiertos y cerrados en 4,4 meses según METR; el mejor abierto va tres puntos por detrás del líder cerrado costando un 60%.

2 min de lecturaTom's Hardware0 vistas

Mozilla ha publicado la versión 1.1 de su informe sobre el estado de la IA de código abierto, con datos cerrados al 1 de septiembre. Su conclusión: los mejores modelos de pesos abiertos salidos de China están a unos cuatro meses de los modelos frontera estadounidenses, siguen por detrás en algunas pruebas y cuestan bastante menos.

El informe se publicó el 15 de septiembre y lo firma la fundación Mozilla, así que conviene leerlo sabiendo de dónde viene: no es un laboratorio vendiendo su próximo modelo, es una organización que lleva años defendiendo el desarrollo abierto. Los números que cita, eso sí, no son suyos: el Índice de Inteligencia es de Artificial Analysis.

Los números

En ese índice, el mejor modelo abierto se queda a tres puntos del líder cerrado, y lo hace costando el 60% del precio. Frente a Claude Fable 5 la distancia es de dos puntos, con un coste del 30%: un tercio, para una diferencia que en muchas tareas no se nota.

Mozilla va más allá del índice y ajusta los datos de horizonte de tareas de METR. Ese ajuste coloca la brecha entre abierto y cerrado en unos 4,4 meses, prácticamente el mismo cálculo que hace Epoch AI, que habla de cuatro meses. El horizonte de tareas mide cuánto trabajo autónomo aguanta un modelo antes de perder el hilo; cuatro meses de retraso significan que lo que hoy resuelve el mejor cerrado, un abierto lo resolverá en el próximo trimestre largo.

Qué cambia para quien despliega

El coste. Si la diferencia de calidad son dos o tres puntos y el precio es un tercio o el 60%, hay cargas donde la decisión se toma sola: inferencia masiva, clasificación a escala, agentes internos que no salen de la red corporativa. En otras, tres puntos siguen siendo tres puntos y la elección no se mueve.

Hay una coletilla en el titular que importa: "en algunas pruebas". El informe no dice que la brecha se haya cerrado, dice que se ha estrechado en las métricas que mide. Los benchmarks agregados son cómodos de citar y malos para predecir cómo se comportará un modelo concreto con los datos de la empresa que lo va a servir.

Lo que queda por ver es el ritmo. La cifra de 4,4 meses es un ajuste sobre datos históricos, no una predicción, y una diferencia de cuatro meses solo se mantiene si los laboratorios chinos siguen publicando pesos con la misma frecuencia. Si esa cadencia se corta, el número se va al garete en dos trimestres.

Aun así, el punto de fondo no es el retraso sino el precio. Un modelo abierto se descarga, se audita y se sirve en infraestructura propia, sin depender de una API ajena ni de que a otro le apetezca subir la tarifa. Para el que firma el presupuesto, eso pesa más que dos puntos en un índice.