[论文解读] Private Reinforcement Learning with PAC and Regret Guarantees
本文提出PUCB,一种私有强化学习算法,在回合式马尔可夫决策过程(episodic Markov decision processes)中同时实现PAC和遗憾保证,并满足联合差分隐私(JDP)。该算法以最小的效用损失实现隐私保护,隐私参数ε仅影响样本复杂度和遗憾界中的低阶项,因此适用于个性化医学等高风险应用场景。
Motivated by high-stakes decision-making domains like personalized medicine where user information is inherently sensitive, we design privacy preserving exploration policies for episodic reinforcement learning (RL). We first provide a meaningful privacy formulation using the notion of joint differential privacy (JDP)--a strong variant of differential privacy for settings where each user receives their own sets of output (e.g., policy recommendations). We then develop a private optimism-based learning algorithm that simultaneously achieves strong PAC and regret bounds, and enjoys a JDP guarantee. Our algorithm only pays for a moderate privacy cost on exploration: in comparison to the non-private bounds, the privacy parameter only appears in lower-order terms. Finally, we present lower bounds on sample complexity and regret for reinforcement learning subject to JDP.
研究动机与目标
- 解决个性化医学等敏感领域中强化学习的隐私-效用权衡问题。
- 在持续观测下,通过联合差分隐私(JDP)形式化回合式RL中具有意义的隐私概念。
- 设计一种私有探索算法,在JDP下保持强学习保证(PAC和遗憾界)。
- 建立任意ε-JDP强化学习算法在样本复杂度和遗憾上的紧下界。
提出的方法
- 引入回合式联合差分隐私(JDP)作为RL的隐私形式化方法,确保每个用户的交互数据均受到保护。
- 设计PUCB,一种基于乐观探索的算法,通过引入噪声实现ε-JDP,同时保持学习性能。
- 结合上置信度上限(UCB)原则与Q值的私有估计,平衡探索与隐私。
- 对每个初始状态的首个动作输出应用差分隐私机制,将问题简化为私有多臂老虎机问题。
- 利用现有的私有老虎机遗憾下界,推导私有RL的理论极限。
- 构造困难的MDP实例,证明在ε-JDP下样本复杂度与遗憾的下界。
实验结果
研究问题
- RQ1我们能否设计一种强化学习算法,在不显著损害学习性能的前提下提供正式的隐私保证?
- RQ2联合差分隐私(JDP)如何应用于具有用户特定输出的回合式RL中的序列决策?
- RQ3在RL中实现ε-JDP所需的最小效用成本(以样本复杂度和遗憾衡量)是多少?
- RQ4在回合式RL中,ε-JDP下的样本复杂度与遗憾的上下界如何比较?
- RQ5私有强化学习中的探索能否仅对隐私参数ε呈现低阶依赖?
主要发现
- PUCB在保持非私有样本复杂度和遗憾率作为主导项的同时,实现了ε-JDP保证。
- PUCB的样本复杂度为Õ(SAH⁴/α² + S²AH⁴/(εα)),其中隐私项仅出现在低阶项中。
- PUCB的遗憾为Õ(H²√(SAT) + (SAH³ + S²AH³)/ε),隐私仅影响低阶分量。
- 本文建立了样本复杂度下界Õ(SAH²/α² + SAH/(εα)),在主导项上与上界匹配。
- 证明了遗憾下界为Ω(√(HSAT) + SAH log T / ε),表明隐私成本随状态空间大小S线性增长。
- 结果表明,当α较小时且T较大时,隐私成本可忽略不计,验证了该方法的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。