[论文解读] Learning to Reason for Text Generation from Scientific Tables
本文提出 SciGen,首个面向科学表格的、需进行算术推理的大规模数据集,用于推理感知的文本生成。评估了 BART 和 T5 等最先进模型,发现尽管生成文本流畅,但在事实正确性方面存在严重缺陷,且缺乏可靠的自动评估指标是主要瓶颈,人类评估显示即使在最佳情况下,事实正确率也仅有 40%。
In this paper, we introduce SciGen, a new challenge dataset for the task of reasoning-aware data-to-text generation consisting of tables from scientific articles and their corresponding descriptions. Describing scientific tables goes beyond the surface realization of the table content and requires reasoning over table values. The unique properties of SciGen are that (1) tables mostly contain numerical values, and (2) the corresponding descriptions require arithmetic reasoning. SciGen is therefore the first dataset that assesses the arithmetic reasoning capabilities of generation models on complex input structures, i.e., tables from scientific articles. We study the effectiveness of state-of-the-art data-to-text generation models on SciGen and evaluate the results using common metrics as well as human evaluation. Our results and analyses show that (a) while humans like to reason for describing scientific tables, the ability of state-of-the-art models is severely limited on this task, (b) while adding more training data improves the results, it is not the solution for reasoning-aware text generation, and (c) one of the main bottlenecks for this task is the lack of proper automatic evaluation metrics. The data, code, and annotations for human evaluation will be available at https://github.com/UKPLab/SciGen. SciGen opens new avenues for future research in reasoning-aware text generation and evaluation.
研究动机与目标
- 填补现有数据到文本生成模型在描述科学表格时缺乏算术推理能力的空白。
- 创建一个高质量、可扩展的数据集,用于基于含数值的科学表格的推理感知文本生成。
- 开发一种无监督管道,从 LaTeX 文件中提取高质量的表格-描述配对,以减少对昂贵专家标注的依赖。
- 使用自动指标和人工评估,对最先进模型(如 BART、T5)在推理感知文本生成上的表现进行评估。
- 识别现有自动评估指标的局限性,并展示其在推理密集型生成任务中与人类判断的相关性差。
提出的方法
- 从计算机科学领域的科学论文中收集并整理 1.3K 个专家标注的表格-描述配对,重点关注需要算术推理的任务(如 argMax、比较、减法)。
- 开发一种无监督提取管道,自动从 LaTeX 文件中将表格与其对应描述配对,实现可扩展的数据收集。
- 通过结合专家标注和自动提取的配对,创建三个数据集划分:少样本(专家标注)、中等规模和大规模。
- 应用后处理和过滤技术,剔除低质量的自动提取配对,确保训练数据的高质量。
- 在 SciGen 数据集上微调最先进序列到序列模型(BART 和 T5),用于从表格生成文本。
- 使用每条陈述四个标签的人工评估:蕴含、多余、错误和幻觉,以计算召回率、精确率、正确率和幻觉率。
实验结果
研究问题
- RQ1最先进预训练语言模型在需要算术推理的科学表格推理感知文本生成任务中的表现如何?
- RQ2添加自动提取的训练数据对模型性能和事实正确性有何影响?
- RQ3常见自动评估指标(如 BLEU、ROUGE)在评估推理感知文本生成任务中的可靠性如何?
- RQ4当前模型在从科学表格生成描述时的主要失败模式是什么?
- RQ5人类评估在多大程度上揭示了自动指标未能检测到的局限性?
主要发现
- 如 BART 和 T5 等最先进模型生成的文本流畅且连贯,但由于算术推理能力差,超过 60% 的情况下事实错误。
- 人工评估显示,只有 40% 的生成陈述在事实上正确,且仅 10% 的黄金标准陈述被覆盖,表明存在巨大性能差距。
- 添加自动提取的训练数据可提高召回率、精确率和正确率,同时减少幻觉,但大规模设置的正确率低于中等规模设置,可能由于领域偏移所致。
- 常见自动指标如 BLEU 和 ROUGE 与人类判断无相关性,无法可靠区分高质量与低质量输出。
- 人工评估揭示,错误陈述通常在事实上错误但与表格相关(如错误陈述模型性能比较),凸显了关键的失败模式。
- 缺乏可靠的自动评估指标被确定为推理感知文本生成进展的主要瓶颈,人工评估对于有意义的评估至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。