[论文解读] MoFE: Mixture of Factual Experts for Controlling Hallucinations in Abstractive Summarization.
MoFE,一种事实专家混合模型,通过使用实体重叠和依存弧蕴含度量指标,利用强化学习训练专门的专家以最小化事实不一致,从而在摘要生成中减少幻觉。它在XSUM和CNN/DM数据集上提升了事实一致性,同时保持了ROUGE分数不变,并且在问答事实性与BERTScore精确度等未见度量指标上也表现出泛化能力。
Neural abstractive summarization models are susceptible to generating factually inconsistent content, a phenomenon known as hallucination. This limits the usability and adoption of these systems in real-world applications. To reduce the presence of hallucination, we propose the Mixture of Factual Experts (MoFE) model, which combines multiple summarization experts that each target a specific type of error. We train our experts using reinforcement learning (RL) to minimize the error defined by two factual consistency metrics: entity overlap and dependency arc entailment. We construct MoFE by combining the experts using two ensembling strategies (weights and logits) and evaluate them on two summarization datasets (XSUM and CNN/DM). Our experiments on BART models show that the MoFE improves performance according to both entity overlap and dependency arc entailment, without a significant performance drop on standard ROUGE metrics. The performance improvement also transfers to unseen factual consistency metrics, such as question answer-based factuality evaluation metric and BERTScore precision with respect to the source document.
研究动机与目标
- 解决神经生成摘要模型中的事实不一致(幻觉)问题。
- 通过训练针对摘要中不同错误类型的专门专家来减少幻觉。
- 利用强化学习结合两种事实一致度量(实体重叠与依存弧蕴含)来提升事实一致性。
- 评估事实一致性性能的提升是否可泛化到训练中未使用的度量指标。
- 在提升摘要输出的事实保真度的同时,保持较强的ROUGE性能。
提出的方法
- 训练多个专注于不同类型事实错误的专门摘要专家。
- 使用强化学习优化每个专家,使其最小化基于两种事实一致度量(实体重叠与依存弧蕴含)的奖励信号。
- 采用两种集成策略组合专家:加权平均与logit级融合。
- 在两个基准数据集XSUM和CNN/DM上评估MoFE模型,使用基于BART的架构。
- 使用ROUGE度量评估生成质量,确保在标准自动评估指标上无性能下降。
- 测试事实一致性改进在未见度量上的可迁移性,包括问答事实性与BERTScore精确度。
实验结果
研究问题
- RQ1在特定事实错误类型上训练专门专家,是否能减少生成摘要中的幻觉?
- RQ2通过加权和logit级集成策略组合专家,是否能在不降低ROUGE分数的前提下提升事实一致性?
- RQ3在实体重叠与依存弧蕴含度量上的改进,在多大程度上可泛化到其他事实一致度量?
- RQ4MoFE框架是否能在显著减少幻觉的同时保持强大的生成质量?
- RQ5模型在事实一致性上的改进是否可迁移至未见评估度量,如BERTScore精确度与问答事实性?
主要发现
- MoFE在XSUM和CNN/DM数据集上提升了事实一致性,表现为更高的实体重叠与依存弧蕴含得分。
- 该模型在标准ROUGE度量上保持了强劲表现,表明生成质量未下降。
- 事实一致性改进可泛化至未见度量,包括问答事实性评估与源文档相关的BERTScore精确度。
- 使用事实一致度量的强化学习能有效在多种评估设置下减少幻觉。
- 集成策略(权重与logit)成功结合专家输出,提升了事实保真度。
- 该方法在训练中使用的具体度量之外,也展现出事实一致性改进的可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。