[论文解读] UP5: Unbiased Foundation Model for Fairness-aware Recommendation
本文提出UP5,一种用于公平性感知推荐的新型无偏基础模型,采用反事实公平提示(CFP)来缓解大语言模型(LLMs)中的用户侧不公平性。CFP通过个性化前缀提示和提示混合模块,在保持推荐性能的同时实现属性特定的公平性,从而在MovieLens-1M和Insurance数据集上实现了最先进的公平性与准确性表现。
Recent advances in Foundation Models such as Large Language Models (LLMs) have propelled them to the forefront of Recommender Systems (RS). Despite their utility, there is a growing concern that LLMs might inadvertently perpetuate societal stereotypes, resulting in unfair recommendations. Since fairness is critical for RS as many users take it for decision-making and demand fulfillment, this paper focuses on user-side fairness for LLM-based recommendation where the users may require a recommender system to be fair on specific sensitive features such as gender or age. In this paper, we dive into the extent of unfairness exhibited by LLM-based recommender models based on both T5 and LLaMA backbones, and discuss appropriate methods for promoting equitable treatment of users in LLM-based recommendation models. We introduce a novel Counterfactually-Fair-Prompt (CFP) method towards Unbiased Foundation mOdels (UFO) for fairness-aware LLM-based recommendation. Experiments are conducted on two real-world datasets, MovieLens-1M and Insurance, and compared with both matching-based and sequential-based fairness-aware recommendation models. Results show that CFP achieves better recommendation performance with a high level of fairness. Data and code are open-sourced at https://github.com/agiresearch/UP5.
研究动机与目标
- 探究并量化在推荐系统(RS)中使用的大型语言模型(LLMs)对用户敏感属性(如性别、年龄、婚姻状况)的不公平性。
- 解决基于LLM的RS中用户侧不公平性的问题,其中依赖用户嵌入的传统公平性方法不再适用。
- 开发一种参数高效且可扩展的方法,实现在不微调整个LLM的前提下实现公平推荐。
- 通过提示工程动态控制敏感属性的影响,以平衡公平性与推荐性能。
- 提供一种可泛化的框架,适用于多种敏感属性和推荐任务。
提出的方法
- 提出三种探测方法,用于检测基于LLM的RS中的不公平性,评估敏感属性(如性别、年龄、婚姻状况)对推荐结果的影响程度。
- 引入反事实公平提示(CFP),一种基于提示的方法,通过为每个敏感属性使用个性化前缀提示,在冻结LLM权重的同时解耦敏感信息。
- 采用提示混合模块,将多个单属性提示组合,以生成具有多个敏感属性用户的公平推荐。
- 设计提示令牌重加权模块,在推理过程中重新加权前缀提示中的令牌,以平衡公平性与推荐准确性。
- 在对抗训练中使用多分类器作为判别器,以衡量并减少模型输出中敏感属性的泄露。
- 验证软探测提示作为判别器的有效性,发现其在公平性训练中强度不足,相较于分类器效果较差。

实验结果
研究问题
- RQ1基于LLM的推荐系统在多大程度上对基于性别、年龄或婚姻状况等敏感属性的用户表现出不公平性?
- RQ2基于提示的方法是否能在不微调基础模型的前提下,有效缓解基于LLM的推荐系统中的用户侧不公平性?
- RQ3如何在保持高推荐性能的同时,实现对多个敏感属性的公平性保障?
- RQ4基于提示的公平性缓解方法中,公平性与推荐准确性的权衡关系如何?应如何优化?
- RQ5在对抗训练中,软探测提示是否足以作为公平性训练的判别器?还是需要更强的分类器?
主要发现
- 探测实验确认,基于LLM的推荐系统存在显著不公平性,性别和年龄等敏感属性可从模型输出中可靠推断。
- UP5在MovieLens-1M和Insurance数据集上均达到最先进性能,在hit@1和AUC指标上均优于现有公平性感知模型。
- 提示令牌重加权模块有效平衡了公平性与推荐性能,消融实验表明其在不降低准确性的前提下提升了公平性。
- 较长的提示长度可提升推荐性能但降低公平性,而更高的判别器权重可增强公平性但损害性能,表明需进行调优的权衡关系。
- 使用多分类器作为判别器在训练反事实公平提示时显著优于软探测提示,因为软探测提示无法有效检测残留的属性信息。
- CFP方法将敏感属性推断能力降低至接近50%(AUC接近50%),同时保持了高推荐质量,证明了公平性与性能的成功解耦。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。