Skip to main content
QUICK REVIEW

[论文解读] Private Reinforcement Learning with PAC and Regret Guarantees

Giuseppe Vietri, Borja Balle|arXiv (Cornell University)|Sep 18, 2020
Privacy-Preserving Technologies in Data参考文献 22被引用 8
一句话总结

本文提出PUCB,一种私有强化学习算法,在回合式马尔可夫决策过程(episodic Markov decision processes)中同时实现PAC和遗憾保证,并满足联合差分隐私(JDP)。该算法以最小的效用损失实现隐私保护,隐私参数ε仅影响样本复杂度和遗憾界中的低阶项,因此适用于个性化医学等高风险应用场景。

ABSTRACT

Motivated by high-stakes decision-making domains like personalized medicine where user information is inherently sensitive, we design privacy preserving exploration policies for episodic reinforcement learning (RL). We first provide a meaningful privacy formulation using the notion of joint differential privacy (JDP)--a strong variant of differential privacy for settings where each user receives their own sets of output (e.g., policy recommendations). We then develop a private optimism-based learning algorithm that simultaneously achieves strong PAC and regret bounds, and enjoys a JDP guarantee. Our algorithm only pays for a moderate privacy cost on exploration: in comparison to the non-private bounds, the privacy parameter only appears in lower-order terms. Finally, we present lower bounds on sample complexity and regret for reinforcement learning subject to JDP.

研究动机与目标

  • 解决个性化医学等敏感领域中强化学习的隐私-效用权衡问题。
  • 在持续观测下,通过联合差分隐私(JDP)形式化回合式RL中具有意义的隐私概念。
  • 设计一种私有探索算法,在JDP下保持强学习保证(PAC和遗憾界)。
  • 建立任意ε-JDP强化学习算法在样本复杂度和遗憾上的紧下界。

提出的方法

  • 引入回合式联合差分隐私(JDP)作为RL的隐私形式化方法,确保每个用户的交互数据均受到保护。
  • 设计PUCB,一种基于乐观探索的算法,通过引入噪声实现ε-JDP,同时保持学习性能。
  • 结合上置信度上限(UCB)原则与Q值的私有估计,平衡探索与隐私。
  • 对每个初始状态的首个动作输出应用差分隐私机制,将问题简化为私有多臂老虎机问题。
  • 利用现有的私有老虎机遗憾下界,推导私有RL的理论极限。
  • 构造困难的MDP实例,证明在ε-JDP下样本复杂度与遗憾的下界。

实验结果

研究问题

  • RQ1我们能否设计一种强化学习算法,在不显著损害学习性能的前提下提供正式的隐私保证?
  • RQ2联合差分隐私(JDP)如何应用于具有用户特定输出的回合式RL中的序列决策?
  • RQ3在RL中实现ε-JDP所需的最小效用成本(以样本复杂度和遗憾衡量)是多少?
  • RQ4在回合式RL中,ε-JDP下的样本复杂度与遗憾的上下界如何比较?
  • RQ5私有强化学习中的探索能否仅对隐私参数ε呈现低阶依赖?

主要发现

  • PUCB在保持非私有样本复杂度和遗憾率作为主导项的同时,实现了ε-JDP保证。
  • PUCB的样本复杂度为Õ(SAH⁴/α² + S²AH⁴/(εα)),其中隐私项仅出现在低阶项中。
  • PUCB的遗憾为Õ(H²√(SAT) + (SAH³ + S²AH³)/ε),隐私仅影响低阶分量。
  • 本文建立了样本复杂度下界Õ(SAH²/α² + SAH/(εα)),在主导项上与上界匹配。
  • 证明了遗憾下界为Ω(√(HSAT) + SAH log T / ε),表明隐私成本随状态空间大小S线性增长。
  • 结果表明,当α较小时且T较大时,隐私成本可忽略不计,验证了该方法的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。