BookinglyTech News
Inteligencia artificial

IBM lanza Granite PatchTST-FM-r2, modelo de series temporales con licencia Apache 2.0

El modelo de 385M parámetros lidera el ranking de cero disparo en GIFT-Eval entre los de licencia permisiva, con arquitectura Conformer y soporte de imputación.

2 min de lecturaHugging Face Blog0 vistas

IBM ha publicado Granite Time Series PatchTST-FM-r2, la nueva versión de su modelo fundacional para forecasting, disponible en Hugging Face con doble licencia Apache 2.0 y OpenMDW 1.0. El modelo, de ~385M parámetros, se sitúa como el mejor de su categoría en el leaderboard GIFT-Eval entre los modelos replicables de cero disparo con licencia permisiva, y el segundo en general, solo por detrás de TimesFM-3.

La principal novedad frente a la versión r1 está en la arquitectura. IBM ha sustituido los bloques transformer estándar por bloques Conformer, que combinan atención multi-cabeza con convolución temporal. Esa convolución aporta un sesgo inductivo hacia la estructura local, mientras que la atención se concentra en dependencias de largo alcance. La combinación mejora las métricas de error y produce predicciones más suavizadas entre parches, un problema conocido en los modelos basados en parcheado.

El modelo acepta contextos de hasta 8.192 puntos y genera predicciones probabilísticas mediante una cabeza de 99 cuantiles. Además incorpora soporte para imputación de valores ausentes, algo que no estaba en la versión anterior. IBM ha publicado los pesos, la arquitectura, el pipeline de inferencia y el código para reproducir los resultados en el repositorio de GitHub.

En la evaluación GIFT-Eval, el modelo consigue un CRPS geométrico de 0,467 y un MASE de 0,6846 en cero disparo, y sigue siendo competitivo cuando se comparan modelos que han sido preentrenados con los datos de evaluación: queda tercero en CRPS y cuarto en MASE, por delante de Chronos-2, Timer-S1 y varias variantes de Toto, a pesar de que algunos de esos modelos son considerablemente más grandes.

La compañía también muestra cómo integrar el modelo con productos de Confluent para forecasting en streaming, aunque ese aspecto es secundario frente al lanzamiento del modelo en sí. IBM mantiene la apuesta por una licencia que permite uso comercial sin fricciones, una decisión que contrasta con otros proyectos de la industria que han endurecido sus términos recientemente.

Lo que queda por ver es cómo se comporta el modelo en producción fuera de los benchmarks, sobre todo en dominios con series muy heterogéneas. La imputación y la predicción probabilística son características que los equipos de ingeniería van a agradecer. Si necesitas un modelo de cero disparo para demanda, energía o telemetría, este es un candidato serio.