Skip to main content
QUICK REVIEW

[论文解读] MoFE: Mixture of Factual Experts for Controlling Hallucinations in Abstractive Summarization.

Prafulla Kumar Choubey, Jesse Vig|arXiv (Cornell University)|Oct 14, 2021
Topic Modeling参考文献 36被引用 5
一句话总结

MoFE,一种事实专家混合模型,通过使用实体重叠和依存弧蕴含度量指标,利用强化学习训练专门的专家以最小化事实不一致,从而在摘要生成中减少幻觉。它在XSUM和CNN/DM数据集上提升了事实一致性,同时保持了ROUGE分数不变,并且在问答事实性与BERTScore精确度等未见度量指标上也表现出泛化能力。

ABSTRACT

Neural abstractive summarization models are susceptible to generating factually inconsistent content, a phenomenon known as hallucination. This limits the usability and adoption of these systems in real-world applications. To reduce the presence of hallucination, we propose the Mixture of Factual Experts (MoFE) model, which combines multiple summarization experts that each target a specific type of error. We train our experts using reinforcement learning (RL) to minimize the error defined by two factual consistency metrics: entity overlap and dependency arc entailment. We construct MoFE by combining the experts using two ensembling strategies (weights and logits) and evaluate them on two summarization datasets (XSUM and CNN/DM). Our experiments on BART models show that the MoFE improves performance according to both entity overlap and dependency arc entailment, without a significant performance drop on standard ROUGE metrics. The performance improvement also transfers to unseen factual consistency metrics, such as question answer-based factuality evaluation metric and BERTScore precision with respect to the source document.

研究动机与目标

  • 解决神经生成摘要模型中的事实不一致(幻觉)问题。
  • 通过训练针对摘要中不同错误类型的专门专家来减少幻觉。
  • 利用强化学习结合两种事实一致度量(实体重叠与依存弧蕴含)来提升事实一致性。
  • 评估事实一致性性能的提升是否可泛化到训练中未使用的度量指标。
  • 在提升摘要输出的事实保真度的同时,保持较强的ROUGE性能。

提出的方法

  • 训练多个专注于不同类型事实错误的专门摘要专家。
  • 使用强化学习优化每个专家,使其最小化基于两种事实一致度量(实体重叠与依存弧蕴含)的奖励信号。
  • 采用两种集成策略组合专家:加权平均与logit级融合。
  • 在两个基准数据集XSUM和CNN/DM上评估MoFE模型,使用基于BART的架构。
  • 使用ROUGE度量评估生成质量,确保在标准自动评估指标上无性能下降。
  • 测试事实一致性改进在未见度量上的可迁移性,包括问答事实性与BERTScore精确度。

实验结果

研究问题

  • RQ1在特定事实错误类型上训练专门专家,是否能减少生成摘要中的幻觉?
  • RQ2通过加权和logit级集成策略组合专家,是否能在不降低ROUGE分数的前提下提升事实一致性?
  • RQ3在实体重叠与依存弧蕴含度量上的改进,在多大程度上可泛化到其他事实一致度量?
  • RQ4MoFE框架是否能在显著减少幻觉的同时保持强大的生成质量?
  • RQ5模型在事实一致性上的改进是否可迁移至未见评估度量,如BERTScore精确度与问答事实性?

主要发现

  • MoFE在XSUM和CNN/DM数据集上提升了事实一致性,表现为更高的实体重叠与依存弧蕴含得分。
  • 该模型在标准ROUGE度量上保持了强劲表现,表明生成质量未下降。
  • 事实一致性改进可泛化至未见度量,包括问答事实性评估与源文档相关的BERTScore精确度。
  • 使用事实一致度量的强化学习能有效在多种评估设置下减少幻觉。
  • 集成策略(权重与logit)成功结合专家输出,提升了事实保真度。
  • 该方法在训练中使用的具体度量之外,也展现出事实一致性改进的可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。