[论文解读] Evaluating the Factual Consistency of Abstractive Text Summarization
该论文提出了一种基于 BERT 的弱监督模型,用于通过规则化变换源文档生成的训练数据,评估生成式文本摘要中的事实一致性。该模型联合预测一致性,从源文档中提取支持性语段,并识别摘要中不一致的语段,其性能优于强监督基线模型,并通过可解释的语段高亮展示了辅助人类的潜力。
Currently used metrics for assessing summarization algorithms do not account for whether summaries are factually consistent with source documents. We propose a weakly-supervised, model-based approach for verifying factual consistency and identifying conflicts between source documents and a generated summary. Training data is generated by applying a series of rule-based transformations to the sentences of source documents. The factual consistency model is then trained jointly for three tasks: 1) identify whether sentences remain factually consistent after transformation, 2) extract a span in the source documents to support the consistency prediction, 3) extract a span in the summary sentence that is inconsistent if one exists. Transferring this model to summaries generated by several state-of-the art models reveals that this highly scalable approach substantially outperforms previous models, including those trained with strong supervision using standard datasets for natural language inference and fact checking. Additionally, human evaluation shows that the auxiliary span extraction tasks provide useful assistance in the process of verifying factual consistency.
研究动机与目标
- 解决缺乏验证生成式摘要中事实一致性的评估协议的问题。
- 开发一种可扩展的弱监督方法,用于检测源文档与生成摘要之间的事实不一致。
- 通过引入源文档和摘要的可解释语段抽取,改进事实一致性的评估。
- 证明模型生成的高亮有助于人类标注员进行事实一致性的验证。
提出的方法
- 通过在源文档句子上应用规则化变换来合成训练数据,以模拟事实不一致。
- 训练一个多任务 BERT 模型,用于预测事实一致性,从源文档中提取支持性语段,并识别摘要中的不一致语段。
- 利用最先进摘要模型的错误分析结果获得弱监督信号,避免依赖昂贵的人工标注蕴含或事实核查数据集。
- 将语段抽取组件与一致性预测任务联合训练,以提供决策的可解释依据。
- 在摘要输出上微调模型,并通过人工标注和自动指标进行评估。
- 人工评估比较了在有和无模型提供高亮的情况下,标注速度和标注者间一致性。
实验结果
研究问题
- RQ1基于合成数据的弱监督方法是否能优于在 NLI 和事实核查数据集上进行强监督训练的模型?
- RQ2可解释的语段预测在多大程度上提升了人类在事实一致性验证中的表现?
- RQ3该模型在识别生成式摘要中一致和不一致的陈述方面效果如何?
- RQ4模型生成的高亮对人工标注的效率和可靠性有何影响?
主要发现
- FactCCX 模型在事实一致性检测方面优于在 NLI 和事实核查数据集上训练的强监督基线模型。
- 当借助模型生成的高亮时,人工标注员完成事实一致性任务的速度提高了 21%。
- 使用模型提供的高亮后,标注者间一致性(Fleiss’ κ)提升了 38%,表明标注可靠性提高。
- 模型在源文档中高亮相关语段的准确率达到 65.33%,在摘要中达到 65.66%。
- 语段重叠的 F1 分数达到 0.6207(源文档)和 0.6650(摘要),表明与人工标注语段高度一致。
- 人工评估确认,辅助的语段抽取任务显著有助于事实一致性的验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。