[论文解读] Preference-based Interactive Multi-Document Summarisation
本文提出 APRIL,一种基于偏好的交互式多文档摘要框架,通过结合主动偏好学习与神经强化学习,减少了用户交互轮次。实验表明用户能可靠地提供偏好反馈,且 APRIL 仅需十轮交互即优于当前最先进方法,生成的摘要质量高于非交互式及现有交互式基线方法。
Interactive NLP is a promising paradigm to close the gap between automatic NLP systems and the human upper bound. Preference-based interactive learning has been successfully applied, but the existing methods require several thousand interaction rounds even in simulations with perfect user feedback. In this paper, we study preference-based interactive summarisation. To reduce the number of interaction rounds, we propose the Active Preference-based ReInforcement Learning (APRIL) framework. APRIL uses Active Learning to query the user, Preference Learning to learn a summary ranking function from the preferences, and neural Reinforcement Learning to efficiently search for the (near-)optimal summary. Our results show that users can easily provide reliable preferences over summaries and that APRIL outperforms the state-of-the-art preference-based interactive method in both simulation and real-user experiments.
研究动机与目标
- 探究用户是否能在交互式摘要设置中可靠地提供摘要偏好反馈。
- 解决摘要等主观任务中基于偏好的学习所面临的高样本复杂度问题。
- 减少生成高质量、用户定制化摘要所需的用户交互轮次。
- 开发一种高效学习用户偏好并利用其指导摘要生成的框架。
- 在模拟环境与真实用户设置下评估该框架的鲁棒性与可用性。
提出的方法
- APRIL 将交互式学习过程分为两个阶段:偏好学习与强化学习。
- 采用主动偏好学习(APL)高效地向用户提问,以最大化每次偏好的信息增益。
- 偏好学习模型基于二元比较,估计用户对候选摘要的排序。
- 神经强化学习智能体利用学习到的奖励函数,搜索近似最优摘要。
- 框架使用基于真实用户研究数据的模拟用户模型(LNO)在仿真中验证结果。
- 系统在标准多文档摘要基准上通过仿真与真实用户实验进行评估。
实验结果
研究问题
- RQ1用户是否能在交互式摘要设置中可靠且一致地提供摘要偏好反馈?
- RQ2与绝对评分或词组(bigrams)等其他反馈类型相比,偏好反馈的质量如何?
- RQ3基于偏好的交互式系统是否能减少所需交互轮次,同时保持或提升摘要质量?
- RQ4与当前最先进方法 SPPI 相比,所提出的 APRIL 框架在摘要质量与用户交互成本方面表现如何?
- RQ5模拟用户模型(LNO)在多大程度上准确反映了真实用户偏好?
主要发现
- 用户认为基于偏好的反馈比其他类型(如词组)更简单、更可靠,尤其在摘要质量差异明显时。
- 在真实用户实验中,APRIL 生成的摘要在 82% 的情况下被用户偏好(d100e),在 75% 的情况下被偏好(d068f),显著优于 SPPI。
- APRIL 在 d100e 数据集上的摘要质量平均评分为 4.0(5 分制),而 SPPI 仅为 2.5,显示出统计上显著的优势。
- 模拟用户模型(LNO)与真实用户偏好之间的皮尔逊相关系数高达 0.974(p = 0.145),验证了其在仿真中的有效性。
- 仅需十轮交互,APRIL 生成的摘要质量即优于非交互式方法与 SPPI 基线。
- APRIL 将用户阅读负担减少至 SPPI 的近一半,每 N 轮交互仅需 N+1 份摘要,而 SPPI 需要 2N 份。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。