Skip to main content
QUICK REVIEW

[论文解读] Local Differential Privacy for Regret Minimization in Reinforcement Learning

Evrard Garcelon, Vianney Perchet|arXiv (Cornell University)|Oct 15, 2020
Privacy-Preserving Technologies in Data被引用 12
一句话总结

本文提出了首个在局部微差隐私(LDP)约束下,针对有限时域强化学习的遗憾最小化算法,采用混洗局部机制在数据传输前对用户数据进行隐私化处理。该文建立了遗憾下界 Ω(H√(SAK)/min{e^ε−1,1}),并提出 LDP-OBI 算法,实现 √K/ε 的遗憾,其对 K 和 ε 的依赖关系与下界一致。

ABSTRACT

Reinforcement learning algorithms are widely used in domains where it is desirable to provide a personalized service. In these domains it is common that user data contains sensitive information that needs to be protected from third parties. Motivated by this, we study privacy in the context of finite-horizon Markov Decision Processes (MDPs) by requiring information to be obfuscated on the user side. We formulate this notion of privacy for RL by leveraging the local differential privacy (LDP) framework. We establish a lower bound for regret minimization in finite-horizon MDPs with LDP guarantees which shows that guaranteeing privacy has a multiplicative effect on the regret. This result shows that while LDP is an appealing notion of privacy, it makes the learning problem significantly more complex. Finally, we present an optimistic algorithm that simultaneously satisfies $\\varepsilon$-LDP requirements, and achieves $\\sqrt{K}/\\varepsilon$ regret in any finite-horizon MDP after $K$ episodes, matching the lower bound dependency on the number of episodes $K$.

研究动机与目标

  • 研究局部微差隐私(LDP)对有限时域马尔可夫决策过程(MDP)中遗憾最小化的影响。
  • 在强化学习设置下,建立 ε-LDP 约束的遗憾理论下界。
  • 设计并分析一种满足 ε-LDP 的算法,同时在有限时域 MDP 中最小化遗憾。
  • 证明与联合微差隐私(JDP)相比,LDP 会带来遗憾的乘法代价。

提出的方法

  • 基于随机响应机制,使用局部随机化器 R_p^0/1 对用户的状态-动作-奖励轨迹进行数据隐私化处理,再进行传输。
  • 采用混洗机制以增强隐私放大效果,确保聚合统计量满足 (ε, δ)-DP。
  • 利用隐私化数据构建状态-动作访问次数、转移概率和累积奖励的无偏估计器。
  • 应用一种乐观值迭代方法(LDP-OBI),通过引入隐私感知的置信区间,平衡探索与隐私保护。
  • 基于 [Cheu et al., 2019] 关于混洗隐私的研究结果,推导出隐私化计数器的高概率集中不等式。
  • 采用隐私放大技术,将隐私参数 ε 按时域 H 进行缩放,从而实现本地机制的 Hε-LDP。

实验结果

研究问题

  • RQ1在有限时域强化学习中,LDP 所带来的隐私与遗憾之间存在何种根本性权衡?
  • RQ2能否设计一种强化学习算法,在满足用户数据 ε-LDP 的前提下实现次线性遗憾?
  • RQ3在相同设置下,LDP 下的遗憾与联合微差隐私(JDP)下的遗憾相比如何?
  • RQ4在 LDP 约束下,遗憾对 episode 数 K 和隐私参数 ε 的最优依赖关系是什么?
  • RQ5能否设计一种实用算法,同时满足 LDP 要求并实现接近最优的遗憾?

主要发现

  • 本文为有限时域 MDP 中的 ε-LDP 建立了遗憾下界 Ω(H√(SAK)/min{e^ε−1,1}),表明隐私会带来遗憾的乘法代价。
  • 所提出的 LDP-OBI 算法实现了 √K/ε 的遗憾,其对 K 和 ε 的依赖关系与下界一致,仅相差对数因子。
  • 遗憾界表现为 H²S²A√(KH)/(e^(ε/H)−1),表明当 ε 减小时(隐私要求更强),性能显著下降。
  • 混洗机制实现了隐私放大,使得尽管本地机制满足 LDP,但聚合统计量仍可达到 (ε_k,c, δ₀)-DP。
  • 该方法确保每个用户的原始数据在源头即被隐私化,满足 ε-LDP,同时通过无偏估计仍能实现有效学习。
  • 分析表明,与 JDP 相比,LDP 在强化学习中更具挑战性,因其要求遗憾呈乘法惩罚而非加法惩罚。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。