[论文解读] Pearl: Personalizing Large Language Model Writing Assistants with Generation-Calibrated Retrievers
Pearl 提出了一种基于检索增强的大语言模型(LLM)写作助手,通过一种生成校准的检索器实现个性化输出。该检索器选择用户特定的历史文档以增强提示词,其训练采用了一种新颖的数据选择方法和一种尺度校准的KL散度损失,以优化个性化文本生成。在职场和Reddit文本生成任务的自动评估与人工评估中,Pearl 均优于强基线模型。
Powerful large language models have facilitated the development of writing assistants that promise to significantly improve the quality and efficiency of composition and communication. However, a barrier to effective assistance is the lack of personalization in LLM outputs to the author's communication style, specialized knowledge, and values. In this paper, we address this challenge by proposing Pearl, a LLM writing assistant personalized with a retriever that is trained to be generation-calibrated for personalization. Generation calibration ensures that our retriever selects historic user authored documents to augment an LLM prompt such that they are likely to help an LLM generation better adhere to a users' preferences. We propose two key novelties for training such a retriever: (1) A training data selection method that identifies user requests likely to benefit from personalization and documents that provide that benefit; and (2) A scale-calibrating KL-divergence objective that ensures that our retriever scores remain proportional to the downstream generation quality from using the document for personalized generation. In a series of holistic evaluations, we demonstrate the effectiveness of Pearl in generating long-form texts on multiple social media datasets. Finally, we demonstrate how a generation-calibrated retriever can double as a performance predictor -- detecting low quality retrieval, and improving potentially under-performing outputs via revision with LLMs.
研究动机与目标
- 为解决大语言模型生成文本缺乏个性化的问题,该问题限制了用户对写作助手的信任与采用。
- 通过检索并整合用户特定的历史文档,提升大语言模型输出的相关性与风格一致性。
- 训练一种直接针对个性化生成性能优化的检索器,而非通用检索任务。
- 使检索器能够同时承担低质量生成结果的性能预测功能。
- 在真实写作任务(如职场社交媒体发文与Reddit评论)中验证方法的有效性。
提出的方法
- 训练一种生成校准的检索器,以选择最能个性化大语言模型响应的历史用户撰写文档。
- 采用一种数据选择方法,识别出可能从个性化中受益的用户请求,以及能提供此类益处的文档。
- 使用一种尺度校准的KL散度损失,将辅助生成模型的得分蒸馏到检索器中,使检索与个性化生成质量对齐。
- 利用选定文档作为少样本示例,增强大语言模型的提示词,以引导个性化生成。
- 利用相同的检索器得分预测生成质量,从而实现对低质量输出的有选择性地使用更复杂的大语言模型链式结构。
- 在企业级职场沟通和公开的Reddit评论数据集上,通过自动指标与人工评估对系统进行评估。
实验结果
研究问题
- RQ1基于检索增强的方法能否有效利用用户历史写作内容,实现大语言模型生成文本的个性化?
- RQ2与标准检索基线相比,生成校准的检索器在个性化文本生成中的表现如何?
- RQ3检索器的得分能否用于预测生成质量,并指导大语言模型链式结构的使用?
- RQ4个性化在多大程度上提升了生成文本的风格一致性和事实一致性?
- RQ5该方法是否能在不同写作领域(如职场沟通与社交媒体)中实现泛化?
主要发现
- Pearl 在个性化写作任务的自动指标与人工评估中,均优于强基线的检索增强方法。
- 与非校准基线相比,生成校准的检索器显著提升了大语言模型输出的相关性与风格一致性。
- 检索器的得分成功预测了低质量生成,从而实现了对更复杂大语言模型链式结构的有选择性使用,以提升输出质量。
- 该方法在企业级职场沟通与公开Reddit评论生成任务中均表现出色。
- 尺度校准的KL散度损失有效对齐了检索与个性化生成目标,显著提升了生成质量。
- 人工评估确认,Pearl 生成的输出在语气、结构以及与参考文本的信息内容相似度方面,均优于基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。