[论文解读] Why Tabular Foundation Models Should Be a Research Priority
本文立场论文主张优先开展大型表格模型(LTMs)的研究,这是一种面向表格数据的新一类基础模型,有望通过实现上下文感知、少样本学习及合成数据生成,彻底改变数据科学。作者提倡将LTMs视为高影响力、尚未充分探索的研究前沿,具备推动科学发现、实现隐私保护的数据共享以及构建稳健、包容的机器学习系统的巨大潜力。
Recent text and image foundation models are incredibly impressive, and these models are attracting an ever-increasing portion of research resources. In this position piece we aim to shift the ML research community's priorities ever so slightly to a different modality: tabular data. Tabular data is the dominant modality in many fields, yet it is given hardly any research attention and significantly lags behind in terms of scale and power. We believe the time is now to start developing tabular foundation models, or what we coin a Large Tabular Model (LTM). LTMs could revolutionise the way science and ML use tabular data: not as single datasets that are analyzed in a vacuum, but contextualized with respect to related datasets. The potential impact is far-reaching: from few-shot tabular models to automating data science; from out-of-distribution synthetic data to empowering multidisciplinary scientific discovery. We intend to excite reflections on the modalities we study, and convince some researchers to study large tabular models.
研究动机与目标
- 突出尽管表格数据在现实应用中占主导地位,却在基础模型研究中严重被忽视。
- 论证表格基础模型(LTM)构成一个高影响力、尚未充分探索的研究前沿,其潜力可与文本和视觉基础模型相媲美。
- 解释LTM被忽视的原因:缺乏大规模的表格元数据集、表格机器学习固有的难度,以及人类对视觉和文本的偏见。
- 提出LTM可实现变革性应用,如少样本数据增强、合成数据生成及跨领域数据集成。
- 鼓励研究人员将注意力转向LTM,强调其在公共利益、包容性以及相较于大型语言模型更低的进入门槛方面的潜力。
提出的方法
- 提出大型表格模型(LTM)的概念,作为专为表格数据设计的基础模型,类比于大型语言模型(LLM)和视觉基础模型(vision FMs)。
- 将LTM定位为具备生成合成表格数据、执行跨数据集连接以及通过少样本学习补全缺失列的能力。
- 建议将LTM嵌入用于下游任务,如模型微调或与其他基础模型集成。
- 强调需要大规模、多样化且高质量的表格元数据集来训练LTM,类似于ImageNet对视觉基础模型的推动作用。
- 倡导建立评估协议,以衡量LTM在多样化领域和数据分布下的泛化能力、偏差与可靠性。
- 强调在表格数据中实现可追溯性与身份验证的重要性,以降低滥用风险,相比生成式图像或文本模型更具优势。

实验结果
研究问题
- RQ1为何尽管表格数据在科学与工业中普遍存在,却在基础模型研究中远少于文本与视觉模型受到关注?
- RQ2表格数据在基础模型开发中面临哪些独特挑战,又该如何应对?
- RQ3大型表格模型(LTM)如何实现少样本数据增强、合成数据生成与跨数据集推理?
- RQ4LTM对数据民主化、隐私保护、科学发现与模型鲁棒性可能产生何种潜在影响?
- RQ5如何实现LTM的可靠评估,以及需要哪些保障措施来防止偏差与滥用?
主要发现
- 表格数据是科学、医疗、金融与政府领域中的主导数据模态,但在基础模型研究中却严重被低估。
- 尽管已有如XGBoost等强大基线模型,表格机器学习的发展仍远落后于视觉或自然语言处理,为基础模型创新留下广阔空间。
- LTM能够生成高质量的合成表格数据,保留其统计特性,从而支持隐私保护的数据共享。
- LTM可实现跨数据集推理,例如通过少样本提示推断缺失列或在不同领域间连接数据集。
- 由于数据可追溯性以及缺乏领域专业知识难以伪造可信的表格数据,LTM的滥用风险低于文本与视觉基础模型。
- LTM研究提供一个高影响力、可及性高的研究前沿,其计算门槛远低于大型语言模型,有助于更广泛参与并加速研究进展。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。