Skip to main content
QUICK REVIEW

[论文解读] Local Differentially Private Regret Minimization in Reinforcement Learning.

Evrard Garcelon, Vianney Perchet|arXiv (Cornell University)|Oct 15, 2020
Privacy-Preserving Technologies in Data参考文献 26被引用 4
一句话总结

本文提出了一种针对有限时域马尔可夫决策过程的局部差分隐私(LDP)强化学习算法,在保护用户数据的同时实现了次线性遗憾。通过在用户端实施LDP,该方法在与非私有设置相比时,仅带来乘法性的遗憾成本。

ABSTRACT

Reinforcement learning algorithms are widely used in domains where it is desirable to provide a personalized service. In these domains it is common that user data contains sensitive information that needs to be protected from third parties. Motivated by this, we study privacy in the context of finite-horizon Markov Decision Processes (MDPs) by requiring information to be obfuscated on the user side. We formulate this notion of privacy for RL by leveraging the local differential privacy (LDP) framework. We present an optimistic algorithm that simultaneously satisfies LDP requirements, and achieves sublinear regret. We also establish a lower bound for regret minimization in finite-horizon MDPs with LDP guarantees. These results show that while LDP is appealing in practical applications, the setting is inherently more complex. In particular, our results demonstrate that the cost of privacy is multiplicative when compared to non-private settings.

研究动机与目标

  • 解决个性化强化学习中用户数据包含敏感信息所引发的隐私问题。
  • 使用局部差分隐私(LDP)框架对强化学习中的隐私进行形式化,确保在用户层面实现混淆。
  • 设计一种满足LDP约束的乐观算法,同时实现次线性遗憾。
  • 为LDP保护下的有限时域MDP中的强化学习建立遗憾的理论下界。
  • 量化隐私带来的固有成本,以与非私有设置相比的遗憾增长为度量。

提出的方法

  • 使用局部差分隐私(LDP)框架对有限时域MDP中的隐私进行形式化,要求在数据传输前对用户端数据进行混淆。
  • 设计一种将LDP约束融入学习过程的乐观强化学习算法,确保在数据收集阶段实现隐私保护。
  • 引入一种机制,在客户端对用户观测添加校准噪声,以满足LDP保证。
  • 采用乐观值迭代或类似规划组件,在隐私约束下平衡探索与利用。
  • 分析LDP下的遗憾边界,推导出所提算法的上界以及该问题类别的下界。
  • 通过理论分析比较LDP下与非私有情况下的遗憾标度,揭示出乘法性成本。

实验结果

研究问题

  • RQ1我们能否设计一种强化学习算法,在有限时域MDP中确保局部差分隐私的同时保持次线性遗憾?
  • RQ2在LDP保护的强化学习中,隐私与遗憾性能之间的根本权衡是什么?
  • RQ3与非私有强化学习设置相比,LDP保护下的遗憾如何缩放?
  • RQ4我们能否为LDP保护下的有限时域MDP建立遗憾的理论下界?
  • RQ5在此设置下,隐私的乘法性成本在遗憾增长方面如何体现?

主要发现

  • 所提算法在局部差分隐私约束下实现了次线性遗憾,证明了在有限时域MDP中实现私有强化学习的可行性。
  • 为LDP保护下的有限时域MDP建立了遗憾的理论下界,表明隐私带来的固有局限性。
  • 隐私成本为乘法性,意味着遗憾会随着隐私预算的增加而以一个增长因子缩放。
  • 分析确认,LDP在遗憾增长方面带来了显著但可量化的性能损失。
  • 结果表明,尽管LDP适用于实际部署,但它从根本上增加了强化学习中遗憾最小化的复杂性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。