BookinglyTech News
Inteligencia artificial

Xiaomi anuncia MiMo-V3 con HySparse 2: menos prefill y mejor contexto largo

Rofli Luo, responsable de MiMo en Xiaomi, adelanta que la próxima versión cambia de arquitectura. El nuevo núcleo, HySparse 2, reduce el prefill y la caché KV y mejora el contexto largo.

2 min de lecturaITHome0 vistas

Xiaomi ha puesto nombre a la próxima generación de su modelo de lenguaje. MiMo-V3 llegará con una arquitectura nueva y su núcleo será HySparse 2, presentado el 23 de septiembre. Según el anuncio, ese núcleo recorta el coste de prefill, encoge la caché KV y mejora la recuperación en contextos largos. Lo ha hecho público Rofli Luo, responsable de MiMo en Xiaomi.

El anuncio se queda en lo cualitativo. No hay cifras, ni comparación contra la versión anterior, ni una demo donde se vea el modelo funcionando. La compañía dice que los tres cambios son a mejor, pero no ha enseñado cuánto.

Prefill, caché y contexto largo

El prefill es la fase en la que el modelo digiere el prompt completo antes de generar el primer token. Con contextos de decenas de miles de tokens se come buena parte del tiempo de respuesta y del cómputo. Bajarlo no hace al modelo más listo, pero sí más barato de servir.

La caché KV es el otro sumidero. Cada token ya procesado deja guardados un par de tensores, y esa memoria crece con la longitud del contexto, con el número de capas y con las cabezas de atención. Es lo que convierte atender ventanas largas en un problema de VRAM y no de calidad. Recortar esa caché deja hueco para más peticiones simultáneas o para contextos mayores en la misma GPU.

El tercer punto, la recuperación en contextos largos, es el que más se nota en el día a día: encontrar un dato concreto dentro de un documento extenso sin que se pierda por el camino. Aquí la atención dispersa lleva tiempo siendo la vía obvia, y el nombre de HySparse apunta a esa familia de técnicas, las que evitan que cada token mire a todos los demás.

Lo que no hay es lo que más pesa para decidir. Xiaomi no ha publicado el tamaño del modelo, ni benchmarks, ni cómo piensa distribuirlo. Tampoco ha dicho si MiMo-V3 sustituye a las versiones anteriores o convive con ellas.

Para quien despliega modelos, la arquitectura importa menos que el coste por token y la licencia. Un recorte de caché KV se traduce directamente en menos GPU por petición, que es la métrica que decide si un modelo entra en producción o se queda en el banco de pruebas. Sin números, ese cálculo no se puede hacer. Hasta que lleguen, HySparse 2 es lo único tangible del anuncio, y tampoco se ha dicho dónde se puede usar.