NVIDIA 发布开源表格基础模型 Kumo Tabular,在 TabArena 等四项基准排名第一

📌 One-Sentence Summary
NVIDIA 发布了 Kumo Tabular,这是一款面向表格数据的开源基础模型,通过上下文学习实现零样本分类与回归,在准确率与效率上均超越现有基准。
📝 Summary
NVIDIA 推出了 Kumo Tabular,这是一系列开放权重的基础模型(参数量从 28M 到 215M 不等),旨在取代传统的梯度提升树进行表格预测。该模型采用包含列、行和上下文注意力的专用 Transformer 架构,执行上下文学习,能够在单次前向传播中为新行预测标签,无需针对特定任务进行训练、超参数调整或特征工程。Kumo Tabular 仅在通过结构因果模型(SCM)生成的数百万张合成表格上进行预训练,便在包括 TabArena 和 TALENT 在内的四大主要基准测试中取得了最先进(SOTA)的结果,同时相比之前的表格基础模型提供了显著的推理速度提升。
💡 Main Points
从针对特定任务的训练转向表格数据的上下文学习
与传统梯度提升决策树(GBDT)需要对每个新数据集从头开始训练不同,Kumo Tabular 将表格预测视为基于提示的任务,利用带标签的行作为上下文,在单次前向传播中预测新标签。
面向结构化数据的专用 Transformer 架构
该模型采用三阶段注意力机制:列注意力用于理解值分布,行注意力用于捕捉特征交互,上下文注意力用于将查询行与带标签的示例关联起来。
基于合成结构因果模型(SCM)的预训练
为避免数据隐私问题并确保多样性,模型在由随机因果图生成的数百万张合成表格上进行训练,并融入了缺失值和重尾分布等现实世界的「混乱」特性。
卓越的准确率-效率权衡
Kumo Tabular 在 TabArena、BeyondArena、TALENT 和 ScoringBench 上均排名第一,展示了一条新的帕累托前沿,即在提供更高准确率的同时,速度显著更快(例如比 LimiX-2 快 17 倍)。
💬 Key Quotes
Kumo Tabular 是一款面向表格数据的开源基础模型……它可以在单次前向传播中预测新行的标签,无需训练、无需调优、也无需特征工程。
一个看过数百万张此类表格的模型,学会了在处理这些缺陷时无需任何数据清洗。
Kumo Tabular 在所有三种模型尺寸下,均在准确率-效率帕累托前沿上确立了新的最先进水平。
📊 Article Meta
AI Screening: 88
Source: AIHOT — 精选
Author: noreply@aihot.news (Hugging Face:Blog(RSS))
Category: 人工智能
Language: 英文
Read Time: 12 min
Word Count: 2982
Tags:
AI 与智能应用 , 机器学习 , 模型训练与推理 , 性能优化 , 开源项目
实测过类似工具,作者说的基本属实。
思路清晰,干货满满。