[论文解读] Evaluating Semantic Accuracy of Data-to-Text Generation with Natural Language Inference
本文提出了一种新颖的、无需参考的指标,用于评估数据到文本(D2T)生成中的语义准确性,该方法使用微调后的 RoBERTa 模型进行自然语言蕴涵(NLI)分析。通过将结构化输入数据转换为自然语言模板,并执行双向蕴涵检查——验证生成的文本是否蕴涵输入事实(以检测遗漏)以及输入事实是否蕴涵生成的文本(以检测幻觉)——该方法在 E2E 数据集上达到超过 90% 的准确率,在 WebNLG 数据集上达到超过 75% 的准确率,优于基线指标,并在极少人工干预的情况下接近人类评估的质量。
A major challenge in evaluating data-to-text (D2T) generation is measuring the semantic accuracy of the generated text, i.e. checking if the output text contains all and only facts supported by the input data. We propose a new metric for evaluating the semantic accuracy of D2T generation based on a neural model pretrained for natural language inference (NLI). We use the NLI model to check textual entailment between the input data and the output text in both directions, allowing us to reveal omissions or hallucinations. Input data are converted to text for NLI using trivial templates. Our experiments on two recent D2T datasets show that our metric can achieve high accuracy in identifying erroneous system outputs.
研究动机与目标
- 为解决自动衡量数据到文本生成中语义准确性的问题,因为模型常常遗漏事实或虚构无支持的信息。
- 开发一种可扩展的、无需参考的评估方法,不依赖人工标注的参考或领域特定训练。
- 利用预训练的自然语言蕴涵(NLI)模型检测生成文本中的语义错误,如遗漏和幻觉。
- 在包括 E2E 和 WebNLG 在内的多样化 D2T 数据集上评估该方法的有效性,且在最小人工干预的现实条件下进行。
提出的方法
- 使用简单且一致的模板将每个结构化输入事实转换为自然语言陈述(例如,'Blue Spice 是一家酒吧')。
- 使用在自然语言蕴涵(NLI)任务上微调过的预训练 RoBERTa 模型,对输入事实与生成文本之间的关系进行分类。
- 执行双向蕴涵检查:(1) 将输入事实作为前提,生成文本作为假设(用于检测幻觉);(2) 将生成文本作为前提,输入事实作为假设(用于检测遗漏)。
- 将每对关系分类为蕴涵、矛盾或中性;任一方向出现矛盾即表示存在语义错误。
- 汇总所有输入事实的结果,以确定生成文本的整体语义准确性。
- 在不进行任何领域内微调或使用人工标注参考的情况下应用该方法,仅依赖通用 NLI 模型和基本文本模板。
实验结果
研究问题
- RQ1预训练的 NLI 模型能否有效检测数据到文本生成输出中的语义错误,如遗漏和幻觉?
- RQ2与手工编写脚本或基于参考的指标相比,该基于 NLI 的指标在准确率和可扩展性方面表现如何?
- RQ3通用 NLI 模型在不进行领域特定微调或人工标注参考的情况下,能在多大程度上检测语义不准确性?
- RQ4基于 NLI 的指标的主要失败模式是什么,以及如何通过领域内适应来缓解这些问题?
主要发现
- 所提出的基于 NLI 的指标在 E2E Challenge 数据集上达到 97.8% 的准确率,接近手工脚本的 99.5% 准确率。
- 在更复杂的 WebNLG 数据集上,该指标达到 76.5% 的准确率和 97.6% 的召回率,尽管领域复杂度更高,仍表现出强劲性能。
- 通过在输入事实与生成文本之间双向检查蕴涵关系,该方法能有效检测遗漏和幻觉。
- 人工错误分析确认,该指标标记为错误的许多实例确实存在语义错误,验证了其可靠性。
- 该指标优于无参考的流畅性指标,并在可扩展性和低人工投入的前提下,与人类评估表现相当。
- 即使不进行领域内微调,该方法仍具有效用,且通过小规模领域适应可进一步提升性能,表明具有进一步优化的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。