[论文解读] Privacy-Preserving Multi-Party Contextual Bandits
本文提出了一种隐私保护的多方上下文Bandit算法,使多个参与方可协作训练一个上下文Bandit模型,而无需共享其私有的上下文特征、所选动作或奖励值。通过结合安全多方计算与ε-贪心探索机制,该方法在保持高学习性能的同时确保了差分隐私,相较于非私有基线模型,实现了较强的理论隐私保障,且准确率损失最小。
Contextual bandits are online learners that, given an input, select an arm and receive a reward for that arm. They use the reward as a learning signal and aim to maximize the total reward over the inputs. Contextual bandits are commonly used to solve recommendation or ranking problems. This paper considers a learning setting in which multiple parties aim to train a contextual bandit together in a private way: the parties aim to maximize the total reward but do not want to share any of the relevant information they possess with the other parties. Specifically, multiple parties have access to (different) features that may benefit the learner but that cannot be shared with other parties. One of the parties pulls the arm but other parties may not learn which arm was pulled. One party receives the reward but the other parties may not learn the reward value. This paper develops a privacy-preserving multi-party contextual bandit for this learning setting by combining secure multi-party computation with a differentially private mechanism based on epsilon-greedy exploration.
研究动机与目标
- 使多个参与方可协作训练上下文Bandit模型,而无需暴露其私有的上下文特征、所选动作或奖励值。
- 在各方为诚实但好奇且不共谋的威胁模型下,确保每方数据的差分隐私。
- 通过在安全多方计算框架内使用差分隐私的ε-贪心探索机制,维持高学习性能。
- 提供理论隐私保障,并通过实证验证该算法在分布式、隐私敏感环境中的有效性。
- 识别并解决实际挑战,如数值不稳定性、参与方退出、侧信道泄露以及更强的成员推断攻击。
提出的方法
- 该算法使用安全多方计算(MPC)联合计算策略,而无需暴露各参与方的上下文特征或动作。
- 采用带有差分隐私的ε-贪心探索策略,其中探索概率经过校准,以提供(ε, δ)-差分隐私保障。
- 通过在线性模型对拼接的上下文特征进行学习,模型参数通过以隐私保护方式计算的最小二乘解进行更新。
- 使用秘密共享机制在各方之间表示敏感数据(如上下文向量、奖励),确保任一参与方均无法获知完整数值。
- 使用Sherman-Morrison公式高效更新最小二乘解中的逆矩阵,尽管数值稳定性被指出为一项局限。
- 系统设计确保仅一个参与方知晓所拉动的动作,仅一个参与方观察到奖励,从而保护输入与输出的隐私。
实验结果
研究问题
- RQ1是否可以在不使任何参与方知晓其他参与方的上下文特征、所选动作或奖励值的前提下,训练多方上下文Bandit?
- RQ2如何将差分隐私集成到安全多方计算框架中,以保护上下文Bandit中的敏感数据?
- RQ3在此分布式、隐私保护的设置中,隐私保障与学习性能之间的权衡如何?
- RQ4数值不稳定性与参与方退出在实践中如何影响所提算法的鲁棒性?
- RQ5侧信道攻击或成员推断攻击在多大程度上会威胁系统的隐私,以及如何加以缓解?
主要发现
- 通过结合安全MPC与差分隐私的ε-贪心探索机制,所提算法为每方的上下文特征实现了(ε, δ)-差分隐私。
- 实证评估表明,隐私保护模型的预测准确率接近非私有基线模型,性能差距极小。
- 在诚实但好奇的威胁模型下,该算法维持了强大的隐私保障,即各方遵循协议但可能试图推断私有信息。
- 由于反复使用Sherman-Morrison公式,观察到数值不稳定性,建议通过定期矩阵求逆与正则化来提升稳定性。
- 侧信道攻击(如奖励延迟导致的时序泄露)被识别为潜在威胁,建议通过随机化延迟以防止信息泄露。
- 未来工作需扩展该框架以支持对抗性参与方、更大的动作集合以及更强的成员推断抵抗能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。