[论文解读] LaMP: When Large Language Models Meet Personalization
本文提出了LaMP,一个用于在涵盖文本分类与生成的七个多样化任务中评估个性化语言模型的综合性基准。它提出使用用户资料进行检索增强提示(retrieval-augmented prompting),以提升零样本(zero-shot)和微调(fine-tuned)大语言模型的性能,在整个基准测试中,微调设置下实现了23.5%的相对平均提升,零样本设置下实现了12.2%的相对平均提升。
This paper highlights the importance of personalization in large language models and introduces the LaMP benchmark -- a novel benchmark for training and evaluating language models for producing personalized outputs. LaMP offers a comprehensive evaluation framework with diverse language tasks and multiple entries for each user profile. It consists of seven personalized tasks, spanning three text classification and four text generation tasks. We additionally propose two retrieval augmentation approaches that retrieve personal items from each user profile for personalizing language model outputs. To this aim, we study various retrieval models, including term matching, semantic matching, and time-aware methods. Extensive experiments on LaMP for zero-shot and fine-tuned language models demonstrate the efficacy of the proposed retrieval augmentation approach and highlight the impact of personalization in various natural language tasks.
研究动机与目标
- 为解决在真实世界自然语言处理应用中缺乏对个性化大语言模型(LLMs)进行综合评估的基准问题。
- 开发一个统一的评估框架,支持基于用户和基于时间的个性化设置。
- 研究有效的基于检索的方法,将用户资料整合到大语言模型提示中,且不超出token限制。
- 使用多样化的真实用户数据,为零样本和微调大语言模型在个性化任务上建立基线性能。
- 证明检索增强提示在多个自然语言处理任务中提升个性化效果的有效性。
提出的方法
- LaMP基准包含七个个性化任务:三个文本分类任务(引用识别、电影标签、产品评分)和四个文本生成任务(新闻标题、学术标题、邮件主题、推文改写)。
- 用户资料被定义为历史用户交互记录,包括过往输入和经批准的输出,为每位用户构建个性化上下文。
- 提出两种检索增强提示策略:提示内增强(in-prompt augmentation, IPA),将检索到的资料项直接插入提示中;解码器内融合(fusion-in-decoder),在解码过程中编码并整合资料项。
- 评估了多种检索模型,包括词项匹配、语义匹配和时间感知检索方法,以选择适合提示增强的相关个人资料项。
- 该框架支持两种数据划分方式:基于用户的划分(用于新用户)和基于时间的划分(用于现有用户的未来交互),以支持对泛化能力和长期个性化能力的评估。
- 性能通过标准指标进行评估:分类任务使用准确率/F1,有序评分任务使用平均绝对误差/均方根误差(MAE/RMSE),生成任务使用ROUGE-1/ROUGE-L。
实验结果
研究问题
- RQ1检索增强提示在多样化自然语言处理任务中,对提升个性化语言模型性能的效果如何?
- RQ2微调与结合检索增强的零样本提示在个性化大语言模型上的相对影响是什么?
- RQ3不同检索策略(词项匹配、语义匹配、时间感知)如何影响个性化输出的质量?
- RQ4在零样本和微调设置下,整合用户资料在多大程度上提升了模型性能?
- RQ5标准非个性化模型(如SVM、BERT、BART)与检索增强大语言模型在个性化任务上的表现相比如何?
主要发现
- 检索增强提示显著提升了大语言模型性能,在使用资料检索进行微调时,所有任务的平均相对提升达到23.5%。
- 即使在零样本设置下,所提方法相比现成的大语言模型(如FlanT5-XXL)也实现了12.2%的相对平均提升。
- 在大多数任务中,特别是推文改写和邮件主题生成等生成任务中,解码器内融合方法优于提示内增强。
- 在整个基准测试中,语义检索模型始终优于词项匹配和时间感知方法,尤其在复杂生成任务中表现更优。
- 与检索增强大语言模型相比,非个性化基线模型(如BERT和BART)表现较差:BERT在引用识别任务上的准确率为0.584,BART在新闻标题生成任务上的ROUGE-L得分为0.171。
- 基于时间的划分设置揭示了检索增强模型更强的泛化能力,表明其对用户未来交互的适应能力更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。