[论文解读] Personalized Abstractive Summarization by Tri-agent Generation Pipeline
本文提出了一种三智能体流水线——包括生成器、指导者和编辑者——用于基于大语言模型的个性化抽象摘要生成。该方法使用微调的小型指导者模型,通过编辑者引导的强化学习进行训练,并利用ChatGPT提供的反馈,生成与用户特定需求匹配的编辑指令,显著提升了在DeFacto和CNNDM数据集上摘要与用户偏好的对齐程度。
Tailoring outputs from large language models, like ChatGPT, to implicit user preferences remains a challenge despite their impressive generative capabilities. In this paper, we propose a tri-agent generation pipeline comprising a generator, an instructor, and an editor to enhance output personalization. The generator produces an initial output, the instructor automatically generates editing instructions based on user preferences, and the editor refines the output to align with those preferences. The inference-only large language model (ChatGPT) serves as both the generator and editor, with a smaller model acting as the instructor to guide output generation. We train the instructor using editor-steered reinforcement learning, leveraging feedback from a large-scale editor model to optimize instruction generation. Experimental results on two abstractive summarization datasets demonstrate the effectiveness of our approach in generating outputs that better meet user expectations. Code is available at \url{https://github.com/Wendy-Xiao/chatgpt_editing_summ}
研究动机与目标
- 为解决个性化大语言模型生成摘要以满足特定用户需求的挑战。
- 通过引入迭代式编辑与优化流程,克服一次性生成的局限性。
- 通过使用小型指导者模型生成指令,减少对大模型微调的依赖。
- 通过编辑者引导的强化学习优化指导者,提升其生成指令与用户需求的对齐程度。
- 在抽象摘要任务中评估该框架,以覆盖度和事实一致性作为关键用户标准。
提出的方法
- 生成器(ChatGPT)从输入文本生成初始摘要。
- 较小的指导者模型基于用户需求生成自然语言编辑指令。
- 编辑者(ChatGPT)根据指导者的指令对初始摘要进行修订。
- 指导者首先在人工编写的指令上进行监督微调,随后通过编辑者引导的强化学习进一步优化。
- 强化学习中的奖励函数基于编辑者模型对输出质量的判断,通过自动指标如ROUGE和事实一致性得分进行衡量。
- 该流水线支持迭代优化,多轮指令与编辑可进一步提升摘要与用户期望的对齐程度。

实验结果
研究问题
- RQ1小型指导者模型在大语言模型编辑者的引导下,能否生成显著提升摘要质量的编辑指令?
- RQ2编辑者引导的强化学习在使指导者生成的指令与用户偏好对齐方面有多有效?
- RQ3三智能体流水线中的迭代编辑是否比单步生成更有效地提升与用户需求的对齐程度?
- RQ4在ROUGE和事实一致性方面,该三智能体流水线与基线方法相比性能如何?
- RQ5该框架能否扩展到摘要以外的其他自然语言处理任务?
主要发现
- 三智能体流水线在DeFacto和CNNDM数据集上显著提升了摘要与用户需求的对齐程度。
- 使用编辑者引导的强化学习进行指导者训练,相比仅使用监督微调,能生成更有效的指令。
- 三智能体流水线中的迭代编辑进一步提升了摘要质量,证明了多轮优化步骤的优势。
- 最终模型在ROUGE-L指标上达到与监督微调基线相当的性能,同时仅需对大模型进行极少量微调。
- 该框架有效利用ChatGPT作为编辑者,避免了对大模型的直接微调,降低了计算和访问门槛。
- 该方法在其他以编辑为核心的自然语言处理任务(如维基编辑和数学问题生成)中也展现出良好的扩展潜力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。