Skip to main content
QUICK REVIEW

[论文解读] PoBRL: Optimizing Multi-Document Summarization by Blending Reinforcement Learning Policies

Andy Su, Difei Su|arXiv (Cornell University)|May 18, 2021
Topic Modeling参考文献 32被引用 4
一句话总结

PoBRL 提出了一种新颖的强化学习框架,通过将多文档摘要分解为三个目标——重要性、相关性和长度——并分别训练独立的策略,再通过策略融合提升摘要质量。该方法在 Multi-News 和 DUC-04 数据集上实现了最先进的 ROUGE 分数,并在人工评估中表现更优,通过策略融合显著降低了冗余性并增强了连贯性。

ABSTRACT

We propose a novel reinforcement learning based framework PoBRL for solving multi-document summarization. PoBRL jointly optimizes over the following three objectives necessary for a high-quality summary: importance, relevance, and length. Our strategy decouples this multi-objective optimization into different subproblems that can be solved individually by reinforcement learning. Utilizing PoBRL, we then blend each learned policies together to produce a summary that is a concise and complete representation of the original input. Our empirical analysis shows state-of-the-art performance on several multi-document datasets. Human evaluation also shows that our method produces high-quality output.

研究动机与目标

  • 为解决从多份重叠文档中生成简洁、无冗余且全面摘要的挑战。
  • 通过解耦的强化学习方法,联合优化三个关键摘要目标——重要性、相关性(冗余减少)和长度。
  • 通过策略融合实现全局优化,超越贪婪或局部最优方法(如 MMR),提升摘要质量。
  • 开发一种可扩展且高效的框架,在不同数量的输入文档下均保持高性能。

提出的方法

  • 将多文档摘要分解为三个独立的子问题:句子重要性、相关性(冗余最小化)和摘要长度控制。
  • 针对每个目标使用特定环境的奖励函数,分别训练强化学习策略。
  • 采用动态融合策略,通过从优势函数学习得到的可学习 λ 系数,组合多个策略。
  • 在策略训练和融合过程中,使用 MMR 作为引导机制,以平衡相关性与冗余性。
  • 利用分层文档结构提升策略泛化能力与句子表征质量。
  • 采用 ROUGE-L 和基于 BERT 的余弦相似度衡量冗余性并评估摘要质量。

实验结果

研究问题

  • RQ1多目标强化学习框架是否能比单策略方法更有效地联合优化多文档摘要中的重要性、相关性和长度?
  • RQ2与使用单一强化学习策略相比,策略融合如何提升摘要质量?
  • RQ3所提出方法在不同数量的输入文档下,能在多大程度上减少冗余性,同时保留关键信息?
  • RQ4基于优势函数的自适应 λ 系数与固定 λ 值相比,在策略融合中表现如何?
  • RQ5该框架在输入文档数量从 2 到 9 的变化下,是否能保持一致的性能表现?

主要发现

  • 在 DUC-04 数据集上,PoBRL 实现了 38.67 的最先进 ROUGE-L F1 分数,优于现有方法(如 RL w/o Blend 的 36.95 和 OCCAMS_V 的 38.50)。
  • 在 Multi-News 数据集上,PoBRL 在 λ=0.9 时取得 38.13 的 ROUGE-L F1 分数,在自适应 λ 下达到 38.67,显著优于基线模型。
  • 模型在 ROUGE-L 重叠度上将冗余性降低了 91.6%(0.19 vs. 2.28),并提升了基于 BERT 的余弦相似度(12.73 vs. 12.49),表明句子层面重复减少。
  • 人工评估显示,PoBRL 在无冗余性方面获得 4.68 的平均最高分,在语法方面得分为 4.28,优于 CopyTransformer、Hi-Map 和 MatchSum。
  • 该方法在输入文档数量从 2 到 9 的范围内均保持一致性能,表现出对输入规模变化的鲁棒性。
  • 策略融合显著优于单策略强化学习(ROUGE-1 从 36.95 提升至 38.67),证实了结合专业化策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。