[论文解读] Balancing Accuracy and Fairness for Interactive Recommendation with Reinforcement Learning
本文提出 FairRec,一种强化学习框架,通过在统一的状态表示中联合建模用户偏好与系统公平性,动态平衡交互式推荐系统(IRS)中的准确率与公平性。通过优化结合转化率与公平性的双重奖励,FairRec 在 MovieLens 和 Kiva 数据集上均优于最先进方法,在推荐质量与公平曝光之间实现了更优权衡。
Fairness in recommendation has attracted increasing attention due to bias and discrimination possibly caused by traditional recommenders. In Interactive Recommender Systems (IRS), user preferences and the system's fairness status are constantly changing over time. Existing fairness-aware recommenders mainly consider fairness in static settings. Directly applying existing methods to IRS will result in poor recommendation. To resolve this problem, we propose a reinforcement learning based framework, FairRec, to dynamically maintain a long-term balance between accuracy and fairness in IRS. User preferences and the system's fairness status are jointly compressed into the state representation to generate recommendations. FairRec aims at maximizing our designed cumulative reward that combines accuracy and fairness. Extensive experiments validate that FairRec can improve fairness, while preserving good recommendation quality.
研究动机与目标
- 为解决交互式推荐系统(IRS)中用户偏好与公平状态随时间动态演变时,准确率与公平性之间的平衡挑战。
- 克服静态公平感知方法在每个时间步强制执行公平性所带来的推荐质量下降的局限性。
- 在联合状态表示中建模用户偏好动态与系统层面的公平状态,以支持动态决策。
- 设计一种双重奖励函数,同时优化转化率与公平性,实现长期平衡。
- 验证该框架在真实 IRS 场景中能否在显著提升公平性指标的同时保持高推荐准确率。
提出的方法
- FairRec 采用强化学习框架,其中智能体基于结合用户偏好状态(UPS)与公平状态(FS)的状态表示选择项目。
- 用户偏好状态(UPS)通过嵌入与注意力机制捕捉个性化偏好及多样性寻求行为。
- 公平状态(FS)追踪不同人口群体的历史曝光与动作分布,以反映当前系统的公平状态。
- 设计双重累积奖励:一个分量最大化转化率(CVR),另一分量通过公平性正则化项最小化不公平性。
- 框架使用深度 Q 网络(DQN)或基于策略的强化学习算法,从用户反馈中随时间学习最优推荐策略。
- 状态表示根据用户交互结果增量更新,支持对偏好与公平条件变化的在线适应。
实验结果
研究问题
- RQ1强化学习框架是否能在长时间交互会话中有效平衡交互式推荐系统中的准确率与公平性?
- RQ2在状态表示中联合建模用户偏好与系统公平性,相较于孤立建模,能否显著改善推荐结果?
- RQ3结合转化率与公平性指标的双重奖励函数,在多大程度上优于仅优化准确率或仅优化公平性的标准目标?
- RQ4所提出的框架是否能在显著减少不同人口群体间不公平曝光分配的同时,保持高推荐质量?
- RQ5FairRec 的各个组成部分——状态表示、奖励设计与学习算法——对整体性能的贡献程度如何?
主要发现
- FairRec 在 MovieLens 数据集上实现最高的整体公平性增益(UFG)6.6776,在 Kiva 数据集上为 2.8555,显著优于基线方法。
- 消融实验表明,FairRec(reward-)(即奖励中省略公平性)在 MovieLens 上实现高 CVR(0.8561),但公平性表现差,证实了公平感知奖励设计的必要性。
- FairRec(state-)(使用简单状态表示)在 MovieLens 上 CVR 显著下降至 0.8194,验证了所提出的联合状态编码的重要性。
- FairRec 在 MovieLens 上保持 0.8702 的高转化率,同时实现 0.8666 的公平性得分(PropFair),表明其在准确率与公平性之间实现了良好平衡。
- 在 Kiva 数据集上,FairRec 实现 CVR 0.6905 与 PropFair 0.8838,证明其在真实微贷款场景中的稳健性能。
- 结果证实,FairRec 通过长期策略学习有效补偿了短期公平性失衡,避免了在每个时间步强制执行公平性的陷阱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。