[论文解读] Table-To-Text generation and pre-training with TabT5
TabT5 是一种基于 T5 的编码器-解码器模型,通过引入行和列的位置嵌入,并在网页表格上采用去噪自编码目标进行预训练,从而提升表格到文本的生成效果。该模型在多个任务中达到最先进水平,包括在电子表格公式预测任务中实现 15% 的序列准确率提升,以及在问答和数据到文本生成任务中 BLEU 和序列准确率分别提升 2.5%。
Encoder-only transformer models have been successfully applied to different table understanding tasks, as in TAPAS (Herzig et al., 2020). A major limitation of these architectures is that they are constrained to classification-like tasks such as cell selection or entailment detection. We present TABT5, an encoder-decoder model that generates natural language text based on tables and textual inputs. TABT5 overcomes the encoder-only limitation by incorporating a decoder component and leverages the input structure with table specific embeddings and pre-training. TABT5 achieves new state-of-the-art results on several domains, including spreadsheet formula prediction with a 15% increase in sequence accuracy, QA with a 2.5% increase in sequence accuracy and data-to-text generation with a 2.5% increase in BLEU.
研究动机与目标
- 为解决仅编码器模型在从表格生成完整文本输出方面的局限性,特别是针对需要自然语言生成的复杂任务。
- 开发一种统一框架,利用表格结构和文本上下文以提升序列到序列的生成效果。
- 在大规模网页表格上使用去噪目标对模型进行预训练,以增强对表格结构和内容的理解。
- 在零样本和 few-shot 设置下,对多种任务(包括公式预测、问答和数据到文本生成)进行评估。
- 通过消融实验分析行/列嵌入和去噪预训练的关键作用,以验证其对性能的贡献。
提出的方法
- TabT5 将表格输入按行线性化,使用专用的位置嵌入为每个单元格编码其行和列位置。
- 该模型基于 T5 的序列到序列架构,采用共享的编码器-解码器 Transformer 架构以实现端到端学习。
- 采用去噪预训练目标,其中 15% 的表格单元格被屏蔽,解码器被训练以重建原始内容。
- 输入表示包含组件类型(例如,问题、表格标题、单元格)以区分输入序列中的语义角色。
- 使用标准序列生成损失在下游任务(如公式预测、问答和数据到文本生成)上对模型进行微调。
- 通过移除行/列嵌入或去噪预训练目标,开展消融实验以评估其对性能的影响。
实验结果
研究问题
- RQ1具备结构化位置嵌入的编码器-解码器 Transformer 架构是否能在表格到文本生成任务中超越仅编码器模型?
- RQ2在网页表格上进行去噪预训练在多大程度上提升了模型在多样化表格到文本任务中的泛化能力?
- RQ3行和列位置嵌入在多大程度上增强了模型理解与生成表格数据文本的能力?
- RQ4当使用有限监督进行微调时,该模型在低资源或分布外表格格式上是否具备良好的泛化能力?
- RQ5生成输出中最常见的错误类型是什么?这些错误与预训练目标和模型架构有何关联?
主要发现
- 与之前最先进方法相比,TabT5 在 Enron 电子表格公式预测基准上实现了 15% 的相对序列准确率提升。
- 在 ToTTo 问答数据集上,TabT5-base 达到 71.61% 的序列准确率,比 T5-base 基线高出 2.21 个百分点。
- 在 FinQA 推理基准上,TabT5-large 实现 70.79% 的程序准确率和 68.00% 的执行准确率,显著优于先前方法。
- 消融实验表明,若移除行/列嵌入或去噪预训练目标,性能均会下降,证实了二者在模型中的关键作用。
- 错误分析显示,55% 的 TabT5 输出是 T5 输出的改写版本,72.5% 的输出可接受(内容正确但有轻微遗漏),表明其具有较强的流畅性和连贯性。
- 相当一部分幻觉(50%)为轻微类型,语义上与真实答案相似,表明模型因预训练而倾向于生成看似合理但错误的命名实体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。