英伟达开源表格基础模型Kumo Tabular:无需训练即可做分类与回归预测
英伟达发布开源表格基础模型Kumo Tabular,隶属于NVIDIA Kumo Structured模型系列,并已上架Hugging Face。给定带标签的表格行,该模型可在单次前向传播中预测新行标签,无需训练、调参或特征工程,同时覆盖分类与回归。模型仅在人工合成数据上预训练,提供约两千八百万至两亿一千五百万参数三档规模,通过开源库运行,并以OpenMDW-1.1许可开放商业使用。官方称其在TabArena、BeyondArena、TALENT与ScoringBench四项基准上排名第一。架构以表格结构为核心的Transformer,借鉴TabICL与TabPFN引入的列注意力、行注意力与上下文注意力:先理解单元格在列内含义,再建模同行各列交互,最后把已标注上下文行与待预测查询行关联;缺失值无需插补即可特殊处理。发布方指出,表格数据仍是企业机器学习主干,而表格基础模型试图把大语言模型式的上下文学习引入表格预测,减少为每个任务从零训练的流程。
