[论文解读] APRIL: Interactively Learning to Summarise by Combining Active Preference Learning and Reinforcement Learning
APRIL 提出了一种新颖的交互式学习框架,结合主动偏好学习与强化学习,实现无需参考摘要的抽取式多文档摘要。通过将过程分离为主动偏好学习阶段和强化学习阶段,APRIL 降低了样本复杂度,并在模拟实验与人类评估中显著优于现有方法,用户始终更偏好 APRIL 生成的摘要而非 SPPI 生成的摘要。
We propose a method to perform automatic document summarisation without using reference summaries. Instead, our method interactively learns from users' preferences. The merit of preference-based interactive summarisation is that preferences are easier for users to provide than reference summaries. Existing preference-based interactive learning methods suffer from high sample complexity, i.e. they need to interact with the oracle for many rounds in order to converge. In this work, we propose a new objective function, which enables us to leverage active learning, preference learning and reinforcement learning techniques in order to reduce the sample complexity. Both simulation and real-user experiments suggest that our method significantly advances the state of the art. Our source code is freely available at https://github.com/UKPLab/emnlp2018-april.
研究动机与目标
- 为解决基于偏好交互式学习在自然语言处理中,特别是文档摘要任务中的高样本复杂度问题。
- 通过直接从用户偏好学习,消除对昂贵参考摘要的依赖。
- 通过一种新型目标函数,将主动偏好学习与强化学习阶段分离,提升交互式摘要的效率与鲁棒性。
- 在模拟与真实用户环境中评估该框架,证明其优于现有方法(如 SPPI)。
- 实现交互式摘要系统在最小人类交互下的实际部署。
提出的方法
- APRIL 引入了一种新目标函数,将学习过程划分为两个阶段:主动偏好学习(APL)与强化学习(RL)。
- 在 APL 阶段,系统主动选择最具信息量的句子对供用户比较,以最小化所需偏好查询的数量。
- 在 RL 阶段,利用收集到的偏好作为稀疏奖励,训练摘要策略,以在长度约束下优化摘要质量。
- 该框架支持集成多种 APL 与 RL 技术,实现灵活且高效的训练。
- APRIL 使用基于排序的奖励机制,而非 ROUGE 分数,使其与神经强化学习模型兼容。
- 系统通过在不同噪声水平下的模拟人工标注者与真实人类用户的受控对比实验进行评估。
实验结果
研究问题
- RQ1基于偏好的交互式学习框架是否能在无需参考摘要的情况下,降低抽取式多文档摘要的样本复杂度?
- RQ2将主动偏好学习与强化学习阶段分离,如何提升学习效率与鲁棒性?
- RQ3APRIL 是否能在自动指标与人类评估中均优于最先进方法 SPPI?
- RQ4在用户反馈存在噪声或不一致的情况下,APRIL 的表现如何?
- RQ5真实用户在多大程度上更偏好 APRIL 生成的摘要而非现有交互式系统生成的摘要?
主要发现
- 在模拟实验中,APRIL 即使在高噪声人工标注者条件下,仅通过 10轮交互,也显著优于 SPPI,生成了更高质量的摘要。
- 在人类评估中,七名用户在 DUC 数据集的三个不同主题下,均一致偏好 APRIL 生成的摘要而非 SPPI 生成的摘要。
- APRIL 生成的摘要在五级李克特量表上持续获得更高评分,证实其在真实用户环境中的优越质量。
- 该框架表现出强大的抗噪声能力,在用户反馈存在错误或不一致时仍能保持高性能。
- APL 与 RL 阶段的分离,使得查询选择更有效,奖励利用更充分,从而减少了所需交互次数。
- APRIL 在 DUC’04 上的表现显著缩小了与理论最大值的差距,超过了 ROUGE-2 的上限 .212。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。