Aioga
AI资讯 / 行业动态
返回 AI资讯

NVIDIA 发布开源表格基础模型 Kumo Tabular,在 TabArena 等四项基准排名第一

Hugging Face:Blog(RSS)Aioga 编辑团队2026-09-29T15:30:38.000Z热度 72

NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。

行业动态Hugging Face:Blog(RSS)

今日 AI 情报摘要

NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。

中文正文 · AI 翻译

NVIDIA Kumo Tabular,是 NVIDIA Kumo Structured 模型集合的一部分,是一个用于表格数据的开放基础模型,目前可在 Hugging Face 上获取:https://huggingface.co/nvidia/Kumo-Tabular。给定包含标签的表格行,它可以在一次前向传播中预测新行的标签,无需训练、无需调优,也无需特征工程,可用于分类和回归。它仅在人工数据上进行了预训练,提供三种规模(从 28M 到 215M 参数),可通过我们的开源库运行:https://github.com/NVIDIA/structured-data-models,并在 OpenMDW-1.1 许可证下发布:https://openmdw.ai/license/1-1/,可用于商业用途。在四个基准测试中排名第一:TabArena:https://github.com/autogluon/tabarena、BeyondArena:https://github.com/autogluon/tabarena、TALENT:https://github.com/LAMDA-Tabular/TALENT 和 ScoringBench:https://github.com/jonaslandsgesell/ScoringBench。

NVIDIA 发布开源表格基础模型 Kumo Tabular,在 TabArena 等四项基准排名第一
NVIDIA 发布开源表格基础模型 Kumo Tabular,在 TabArena 等四项基准排名第一
NVIDIA 发布开源表格基础模型 Kumo Tabular,在 TabArena 等四项基准排名第一
NVIDIA 发布开源表格基础模型 Kumo Tabular,在 TabArena 等四项基准排名第一

表格数据是企业机器学习的核心。客户记录、交易、传感器日志、理赔和订单都存储在表格中,从中预测客户流失、违约、需求或价格是行业内最常见的机器学习任务之一。二十年来,这项工作一直依赖梯度提升树,并取得了良好效果。但这些模型的生命周期几乎没有变化。每遇到一个新问题,都意味着需要收集标签、工程特征、搜索超参数、验证并部署一个对表格一无所知、从零学习每项任务的模型。

大型语言模型展示了处理新任务的不同方式。给出提示中的几个示例,预训练模型无需更新任何权重即可解决任务。这就是上下文学习,它同样适用于表格和文本:一个在数百万表格上预训练的模型可以将带标签的表格作为上下文,直接预测新行的标签。

今天,我们发布了 NVIDIA Kumo Tabular(GitHub:https://github.com/NVIDIA/structured-data-models,HuggingFace:https://huggingface.co/nvidia/Kumo-Tabular),这是一个用于表格分类和回归的开放基础模型。给定带标签的表格行及需预测的行,Kumo Tabular 可以在一次前向传播中返回类别概率或数值预测。

Kumo Tabular 是一个基于表格结构构建的变换器,利用列、行和上下文关注,这一功能在 TabICL:https://github.com/soda-inria/tabicl 和 TabPFN:https://github.com/PriorLabs/tabpfn 中引入。要预测标签,它需要做三件事:(1) 理解每个值在其列中的含义,(2) 理解行列之间的相互作用,(3) 将上下文行与已有标签的上下文行与未知标签的查询行关联起来。Kumo Tabular 的实现方式如下:

:https://cdn-uploads.huggingface.co/production/uploads/684040a5de1ad7f4fcec9508/TkT695UAWJnUIyEydIYRv.png

单元嵌入:一组单元格成为一个符号。数值和类别值通过傅里叶特征、学习频率的正弦和余弦,每种类型有不同的权重。缺失值无需补补,且会被特别处理。最后,上下文中的每个标记都获得标签嵌入。

行嵌入:然后我们通过交替使用两种注意力多次,将每行转化为嵌入。列注意力通过引导自注意,向下观察单一列,了解该值在列分布中的含义,例如42是典型还是极端。因此,其成本随行数线性增长。行注意力会跨越单行的标记,学习特征之间的相互作用,并通过旋转位置区分列。每行加入四个可学习的[CLS]标记,作为行的最终读出。经过行压缩后,最终阶段的成本不再依赖于列数。

上下文学习:最后一个变换器对行嵌入进行操作。上下文行相互关注,而查询行只关注上下文行。因此,每个预测仅依赖上下文和行本身,而非与其他行并列评分的行。由于上下文从不查看查询,其键和值只计算一次,可重复用于后续预测。查询行利用Test-GQA,缩小每个预测读取的缓存。一个头将每个查询行转换为分类类概率和999分位数进行回归,基于此得出点预测和不确定性估计。

长度感知注意力温度:随着键的数量增加,Softmax 注意力会扩散开来。在几百行上非常集中的注意力,在几万行上可能会消散,这正是推理时表格比典型训练表格大得多时的情况。因此,Kumo Tabular 会根据键的数量的对数增加温度来缩放每个查询,并且每个注意力头都有单独学习的系数。其结果是,随着表格长度或宽度增加,注意力仍然保持集中。

Kumo Tabular 完全在人工表格上进行预训练。每个训练表格都是从结构因果模型(SCM)中按以下六个步骤采样的:

:https://cdn-uploads.huggingface.co/production/uploads/684040a5de1ad7f4fcec9508/ipJNJTNO5ZH2zviIdR8eo.png

我们首先为整个表格绘制一个配置,包括其大小、任务、机制和缺失情况。然后,随机因果图将隐藏变量连接起来,通过在每个节点随机抽取的函数(例如线性映射、小型神经网络、树或高斯过程)从根到叶进行评估。一些节点成为数值或类别列,其中一列成为目标,其余的保持隐藏,就像真实数据背后的未测量因果。后处理步骤会关联列组、剪裁异常值并注入缺失值,同时通过快速的树集合检查丢弃任何没有可学习信号的表格。因为生成器是程序化采样器而非训练模型,它可以生成无穷尽的表格,每个表格都有新的图和新的机制。

真实世界的表格很混乱,因此我们在生成器中增加了更多此类不完善之处。值缺失会呈现多种模式,一些特征被粗化,使得重复行可能在标签上不一致,一些类别列包含许多级别,回归目标可能呈现重尾分布。一个见过数百万个此类表格的模型会学会在无需任何清理的情况下处理这些不完善之处。

在每个人工表格上,模型将大部分带有标签的行作为上下文,并学习预测剩余行的标签,对于分类任务使用交叉熵损失,对于回归任务使用分位数损失。分类和回归作为独立模型进行训练。与 TabICLv2 类似,训练分为三个阶段进行。第一阶段最长,使用 1,024 行、最多 100 列的表格,教模型理解表格的样子。第二阶段将上下文行数从 400 变动至 10,240 行,第三阶段扩展至 60,000 行,仍然最多 100 列。总的来说,Kumo Tabular-Small/Medium/Large 分别看到约 3,500 万 / 7,100 万 / 1.37 亿个人工表格。

我们的训练方法和人工数据生成器将很快发布。

我们使用默认设置在完整的 TabArena:https://github.com/autogluon/tabarena 排行榜上运行了三种 Kumo Tabular 尺寸,涵盖经过调优的梯度提升树、AutoGluon 以及最新的表格基础模型。Kumo Tabular 总体排名第一,ELO 为 1950,在统一的单 RTX 6000 Pro 测评环境下,比 LimiX-2:https://github.com/limix-ldm-ai/LimiX 快 17 倍。在三种模型尺寸中,Kumo Tabular 在准确性-效率帕累托前沿上建立了新的最先进水平:

:https://cdn-uploads.huggingface.co/production/uploads/684040a5de1ad7f4fcec9508/CpOXm3g9du6Uw3zQDh2QC.png

我们还在 BeyondArena:https://github.com/autogluon/tabarena、TALENT:https://github.com/LAMDA-Tabular/TALENT 和 ScoringBench:https://github.com/jonaslandsgesell/ScoringBench 上评估了 Kumo Tabular。在 BeyondArena 上,Kumo Tabular 的 ELO 为 1418,改进分数为 7.78%,位列排行榜第一。在 TALENT 上,它在分类准确率、分类对数损失和回归均方根误差上获得整体最高排名,平均排名分别为 6.67、3.98 和 4.22。在用于预测分布的 ScoringBench 中,Kumo Tabular-Large 和 Medium 在平均排名上分别位列第一和第二。

Kumo Tabular 仅适用于数值列和类别列,而文本、图像或时间戳可以通过内置预处理方案转换为特征。单次前向传播最多涵盖 10 个类别,该库通过纠错输出编码扩展到任意数量的类别。当表格超出训练范围很远或查询行与上下文行来自不同分布时,准确率可能下降,因此,与任何预测模型一样,在部署前应在自己的保留数据上验证准确性和校准性。

Kumo Tabular 运行于 NVIDIA 新发布的适用于结构化数据模型的 GPU 原生库上:https://github.com/NVIDIA/structured-data-models。该库在首次使用时会从 Hub 下载权重,并提供我们在评估中使用的预处理、集成和多类别处理功能。以下代码即可将 pandas.DataFrame 转换为预测结果:

Kumo Tabular 依据 OpenMDW 许可协议 1.1 版本发布:/blog/nvidia/(https://openmdw.ai/license/1-1/)。NVIDIA 认为值得信赖的 AI 是共同责任,我们已建立政策和实践以支持广泛的 AI 应用开发。遵循服务条款下载或使用时,开发者应与其所支持的模型团队协作,以确保该模型满足相关行业和使用案例的要求,并防范不可预见的产品滥用。请在此报告模型质量、风险、安全漏洞或 NVIDIA AI 相关问题:https://github.com/NVIDIA/structured-data-models/issues。

我们感谢 David Holzmüller:https://dholzmueller.github.io/ 对 Kumo Tabular 提供的重要想法和消融实验。我们感谢 Vignesh Kothapalli:https://kvignesh1420.github.io/ 在实习期间对 Kumo Tabular 的帮助。

情报判断

Aioga 编辑摘要

NVIDIA 发布开源表格基础模型 Kumo Tabular,面向表格分类与回归。来源称,模型可依据带标签的表格,在单次前向推理中预测新行标签,无需训练、调参或特征工程;并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四项基准排名第一。

背景分析

Kumo Tabular 属于 NVIDIA Kumo Structured 模型系列,采用围绕表格结构设计的 Transformer。来源称其仅使用人工数据预训练,提供 28M 至 215M 参数的三个版本,通过开源库运行,并以 OpenMDW-1.1 许可发布,可用于商业用途。

Aioga 观点

Aioga 判断:这项发布将表格任务的重点放在预训练模型直接处理带标签上下文的方式上。基准排名是来源报告的结果,但现有材料没有提供各项测试的具体条件,不能据此推断模型在所有实际数据集上都占优。

影响与后续

可能影响:免训练推理的设计或值得表格机器学习团队评估,但来源未说明其在特定业务数据上的效果、成本或部署表现。采用前需要结合自身数据验证,并核对许可条款;基准排名不代表对所有任务的效果保证。 后续观察:可关注模型仓库、开源库及四项基准的公开材料,核实评测设置、复现结果与适用限制;若开展试用,建议记录本地数据上的分类和回归表现,并确认其与现有流程的兼容性。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-29T15:30:38.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。

Hugging Face:Blog(RSS)2026-09-29T15:30:38.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。