[论文解读] Reducing Quantity Hallucinations in Abstractive Summarization
本文提出Herman系统,通过在源文本中验证生成摘要中的数量实体(如日期、数字、货币值)来减少抽取式摘要中的幻觉数量。通过重新排序那些数量事实得到支持的摘要,Herman在不显著损失召回率的情况下提升了ROUGE精确率和F1值,人工评估也显示对重新排序后摘要的偏好超过原始摘要。
It is well-known that abstractive summaries are subject to hallucination---including material that is not supported by the original text. While summaries can be made hallucination-free by limiting them to general phrases, such summaries would fail to be very informative. Alternatively, one can try to avoid hallucinations by verifying that any specific entities in the summary appear in the original text in a similar context. This is the approach taken by our system, Herman. The system learns to recognize and verify quantity entities (dates, numbers, sums of money, etc.) in a beam-worth of abstractive summaries produced by state-of-the-art models, in order to up-rank those summaries whose quantity terms are supported by the original text. Experimental results demonstrate that the ROUGE scores of such up-ranked summaries have a higher Precision than summaries that have not been up-ranked, without a comparable loss in Recall, resulting in higher F$_1$. Preliminary human evaluation of up-ranked vs. original summaries shows people's preference for the former.
研究动机与目标
- 为解决抽取式摘要中的事实幻觉问题,特别是针对日期、数字和货币值等数量实体。
- 在不牺牲信息量或流畅性的情况下,提升摘要的事实一致性。
- 开发一种重新排序系统,从候选摘要束中选择具有已验证数量实体的摘要。
- 评估经验证的摘要是否在人工评估中被认为更具忠实度。
- 探讨当前数据集(如XSum)在验证摘要数量事实一致性方面的局限性。
提出的方法
- Herman系统使用弱监督方法识别并验证由抽取式模型生成的候选摘要中的数量实体。
- 通过将摘要中的数量实体替换为源文本中同类型实体,自动构建训练数据。
- 验证模型检查摘要中的每个数量是否在原文中存在相似实体支持。
- 根据已验证数量实体的数量对摘要进行重新排序,优先选择事实一致性更高的摘要。
- 该方法为事后处理,兼容任何生成候选摘要束的抽取式摘要模型。
- 人工评估采用基于Qualtrics的调查,参与者根据数量准确性选择更忠实的摘要,数量部分以高亮形式呈现以便对比。
实验结果
研究问题
- RQ1后处理重新排序系统是否能在不降低整体摘要质量的前提下减少抽取式摘要中的幻觉数量?
- RQ2人工评估者在多大程度上更偏好经过验证数量实体的摘要,而非存在幻觉的摘要?
- RQ3数量实体的事实一致性在多大程度上影响ROUGE分数,特别是精确率和F1值?
- RQ4当前数据集(如XSum)在实现摘要事实准确验证方面存在哪些局限性?
- RQ5基于数量验证的简单重新排序策略是否能优于基线的束搜索选择方法?
主要发现
- Herman生成的重新排序摘要在ROUGE精确率和F1值上均优于原始摘要,表明事实一致性得到提升。
- F1值的提升主要源于精确率的提高,召回率仅出现小幅下降。
- 在19次人工评估中,12次三名评估者意见一致时,均偏好重新排序后的摘要,表明其感知忠实度更强。
- 评估者通常更偏好数量与原文更接近的摘要,即使原始摘要并非完全准确。
- 在21次评估中,13次评估者认为两份摘要均不忠实,但至少两人仍偏好重新排序版本,表明其验证过程提升了感知准确性。
- 该系统性能受限于XSum数据集,因摘要常直接复制文章首句,导致事实验证困难。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。