NVIDIA publica Kumo Tabular, un modelo fundacional para datos tabulares
El modelo predice etiquetas de filas nuevas en una sola pasada, sin entrenamiento ni ingeniería de características, y llega con licencia OpenMDW-1.1 para uso comercial.

NVIDIA ha publicado Kumo Tabular, un modelo fundacional abierto para clasificación y regresión sobre datos tabulares. Lo ha liberado en tres tamaños que van de 28 a 215 millones de parámetros, con licencia OpenMDW-1.1 que permite uso comercial, y el código y los pesos están disponibles en el repositorio de NVIDIA. La compañía dice que encabeza cuatro benchmarks: TabArena, BeyondArena, TALENT y ScoringBench.
La propuesta es la de siempre en esta familia de modelos: le das una tabla con filas etiquetadas y las filas que quieres predecir, y devuelve probabilidades de clase o valores numéricos en un único forward pass. Sin entrenar, sin ajustar hiperparámetros y sin ingeniería de características. Para quien lleva años montando pipelines de gradient boosting para cada pregunta de negocio, el cambio de flujo es evidente: el modelo ya sabe leer tablas y la tarea se resuelve en contexto.
Cómo está construido
Por debajo hay un Transformer con atención de columna, de fila y en contexto, la maquinaria que popularizaron TabPFN y TabICL. Las celdas se agrupan en tokens y pasan por rasgos de Fourier, con pesos separados para valores numéricos y categóricos; los valores ausentes no se imputan, se tratan aparte. La atención de columna mira hacia abajo en una sola columna para saber si un valor es típico o extremo dentro de su distribución, y su coste crece de forma lineal con el número de filas. La atención de fila cruza los tokens de una misma fila con posiciones rotatorias para distinguir columnas. Cuatro tokens [CLS] aprendibles hacen de lectura final de cada fila, y a partir de ahí el coste de la última etapa deja de depender del número de columnas.
La parte en contexto opera sobre los embeddings de fila: las filas de contexto se atienden entre sí y las de consulta solo miran a las de contexto, así que cada predicción depende únicamente de ese contexto y de la fila en cuestión. Como el contexto nunca mira a las consultas, sus claves y valores se calculan una vez y se reutilizan. La cabeza devuelve probabilidades de clase o 999 cuantiles en regresión, de donde salen la predicción puntual y una estimación de incertidumbre.
Uno de los detalles menos habituales es el ajuste de temperatura de atención según la longitud. El softmax se aplana a medida que crecen las claves, y una atención nítida sobre unos cientos de filas puede diluirse sobre decenas de miles, que es justo el escenario cuando la tabla de inferencia es mucho mayor que las de entrenamiento. Kumo Tabular escala cada consulta con una temperatura que crece con el logaritmo del número de claves, con un coeficiente aprendido por cabeza.
Entrenado solo con tablas artificiales
El modelo no ha visto datos reales. Se ha preentrenado por completo con tablas generadas a partir de un modelo causal estructural: se sortea una configuración de tabla, un grafo causal aleatorio conecta variables ocultas que se evalúan de raíz a hoja con funciones también aleatorias, y algunos nodos se convierten en columnas numéricas o categóricas mientras uno pasa a ser el objetivo. Un posprocesado correlaciona grupos de columnas, recorta outliers e inyecta valores ausentes, y un filtro con un ensemble de árboles descarta las tablas sin señal aprendible. Como el generador es muestreador procedural y no un modelo entrenado, la fuente de tablas no se agota.
Queda por ver cómo se comporta en tablas reales sucias y con cardinalidades altas, que es donde este tipo de enfoques suele enseñar los dientes. La comparación honesta no es contra un modelo entrenado a conciencia para una tarea concreta, sino contra el coste de poner ese pipeline en marcha cada vez.