[论文解读] Table Pre-training: A Survey on Model Architectures, Pre-training Objectives, and Downstream Tasks
本综述全面回顾了表格预训练框架,涵盖模型架构、预训练目标及下游任务。它强调了专用注意力机制与自监督目标(如掩码语言建模、去噪和神经SQL执行)如何在表格问答、类型分类和公式预测等任务中实现最先进性能。
Since a vast number of tables can be easily collected from web pages, spreadsheets, PDFs, and various other document types, a flurry of table pre-training frameworks have been proposed following the success of text and images, and they have achieved new state-of-the-arts on various tasks such as table question answering, table type recognition, column relation classification, table search, formula prediction, etc. To fully use the supervision signals in unlabeled tables, a variety of pre-training objectives have been designed and evaluated, for example, denoising cell values, predicting numerical relationships, and implicitly executing SQLs. And to best leverage the characteristics of (semi-)structured tables, various tabular language models, particularly with specially-designed attention mechanisms, have been explored. Since tables usually appear and interact with free-form text, table pre-training usually takes the form of table-text joint pre-training, which attracts significant research interests from multiple domains. This survey aims to provide a comprehensive review of different model designs, pre-training objectives, and downstream tasks for table pre-training, and we further share our thoughts and vision on existing challenges and future opportunities.
研究动机与目标
- 系统性回顾专为结构化表格理解设计的模型架构,包括混合行-列注意力机制与基于树的结构。
- 分析多样化的预训练目标,如掩码列预测、单元格值去噪以及神经SQL执行,以提升表格推理能力。
- 梳理现有表格预训练中的下游任务,包括表格问答、类型分类和公式预测。
- 识别在利用未标注表格进行自监督学习方面存在的开放挑战与未来研究方向。
- 提供统一概述,阐明表格预训练如何推动结构化数据中的迁移学习,特别是在语义解析与数据准备等跨领域应用中。
提出的方法
- 提出表格类型的分类体系(结构良好、半结构化、非结构化)与结构类型(关系型、实体型、矩阵型、布局型),以界定分析范围。
- 回顾关键模型架构,如TaBERT(行方向与列方向注意力)、TaPas(端到端联合推理)、TURL(掩码注意力用于实体链接)、TUTA(双树注意力)以及TaPEx(神经SQL执行器)。
- 分析预训练目标,包括掩码语言建模(MLM)、掩码列预测(MCP)、单元格值去噪,以及学习执行神经SQL以实现表格-文本联合推理。
- 引入UnifiedSKG作为近期方法,直接在21个数据集上的6项任务上微调T5模型,取得优异结果,无需任务特定的预训练。
- 使用T2Dv2、SemTab、WikiTable和TableSense等基准数据集,评估模型在多样化下游任务中的性能。
- 讨论表格预训练与机器学习流水线的集成,包括特征表示学习以及表格检测与清洗等数据准备任务。
实验结果
研究问题
- RQ1表格预训练模型中的专用注意力机制(如行-列注意力、基于树的机制)如何提升在结构化推理任务上的性能?
- RQ2哪些预训练目标最有效地捕捉表格中的语义与结构关系?它们与标准NLP目标相比有何差异?
- RQ3表格预训练模型在表格问答、类型分类和公式预测等多样化下游任务上的泛化能力如何?
- RQ4近期方法如神经SQL执行或直接微调T5如何挑战传统表格理解中的预训练范式?
- RQ5在扩展表格预训练以处理真实世界中异构且噪声较多的表格数据时,其关键局限与开放挑战是什么?
主要发现
- TaBERT与TaPas通过结合混合行-列注意力机制与掩码语言建模,在表格问答基准上实现了最先进性能。
- TURL展示了掩码注意力在关系型表格中学习实体表示方面的有效性,显著提升了表格匹配与增强任务的性能。
- TUTA通过引入结合树状位置编码的统一双树注意力机制,在五个结构化表格理解数据集上达到新的最先进水平。
- TaPEx表明,通过预训练学习神经SQL执行器能显著提升表格-文本联合推理能力,在复杂推理场景中优于传统目标。
- UnifiedSKG通过直接在21个数据集上的6项任务上微调T5模型,取得了有希望甚至最先进结果,表明大规模序列模型可在无需任务特定设计的情况下有效应用于表格预训练。
- 本综述指出,尽管在未标注表格上进行预训练可获得强性能,但在处理多样化表格格式、噪声数据以及超越简单分类或问答的复杂推理方面仍存在挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。