Skip to main content
QUICK REVIEW

[论文解读] Locally Private Distributed Reinforcement Learning

Hajime Ono, Tsubasa Takahashi|arXiv (Cornell University)|Jan 31, 2020
Privacy-Preserving Technologies in Data参考文献 27被引用 19
一句话总结

本文提出了一种名为私有梯度聚合(Private Gradient Collection, PGC)的新框架,用于实现本地差分隐私(LDP)下的分布式强化学习(DRL),从而在保护隐私的环境中实现稳健的策略学习。通过采用拉普拉斯或PRS(泊松拒绝采样)机制向梯度中注入噪声,以满足本地差分隐私要求,PGC使智能体能够在不暴露私有环境细节的情况下贡献更新,从而在LDP约束下实现强隐私保障的同时保持有效的学习性能。

ABSTRACT

We study locally differentially private algorithms for reinforcement learning to obtain a robust policy that performs well across distributed private environments. Our algorithm protects the information of local agents' models from being exploited by adversarial reverse engineering. Since a local policy is strongly being affected by the individual environment, the output of the agent may release the private information unconsciously. In our proposed algorithm, local agents update the model in their environments and report noisy gradients designed to satisfy local differential privacy (LDP) that gives a rigorous local privacy guarantee. By utilizing a set of reported noisy gradients, a central aggregator updates its model and delivers it to different local agents. In our empirical evaluation, we demonstrate how our method performs well under LDP. To the best of our knowledge, this is the first work that actualizes distributed reinforcement learning under LDP. This work enables us to obtain a robust agent that performs well across distributed private environments.

研究动机与目标

  • 解决在分布式强化学习中,本地策略可能无意间泄露私有环境信息的问题。
  • 设计一种DRL框架,确保在私有环境中运行的智能体所报告的梯度满足本地差分隐私(LDP)。
  • 在不损害智能体级别隐私的前提下,实现在多样化私有环境中的稳健策略学习。
  • 在实际DRL设置中评估隐私(由ε控制)与学习效率之间的权衡。

提出的方法

  • 提出私有梯度聚合(PGC)框架,其中本地智能体在私有环境中训练模型,并将经过LDP保护的噪声梯度报告给中央聚合器。
  • 采用两种随机化机制——拉普拉斯机制与PRS(泊松拒绝采样)——向梯度中注入噪声,以确保本地差分隐私。
  • 以异步优势演员-critic(A3C)作为基础算法,通过修改梯度报告方式,在保持学习稳定性的同时保护隐私。
  • 在PRS中引入缓冲机制以提升梯度稳定性,减少噪声引起的训练不稳定性。
  • 中央聚合器使用报告的噪声梯度更新全局模型,从而实现在不同环境间的稳健策略学习。
  • 采用隐私预算ε来控制差分隐私水平,ε越低表示隐私保护越强。

实验结果

研究问题

  • RQ1能否使分布式强化学习在本地智能体于私有环境中训练时,对来自策略的隐私泄露具有鲁棒性?
  • RQ2在DRL设置中,如何在不传输原始数据的前提下,有效对梯度实施本地差分隐私(LDP)?
  • RQ3不同噪声注入机制(拉普拉斯与PRS)对DRL中学习效率及隐私-效用权衡的影响是什么?
  • RQ4隐私预算ε的选择如何影响LDP设置下学习过程的成功率与收敛速度?

主要发现

  • 在ε=2时,PGC-A3C结合PRS机制的成功率(0.95)高于拉普拉斯机制(0.90),表明在强隐私约束下具有更优的早期学习性能。
  • 拉普拉斯机制在ε=10时达到相对AUC为0.965,接近非私有基线(AUC=1.0),表明在宽松隐私条件下具有极强的学习效率。
  • 在ε=2时,PRS机制达到最佳相对AUC(0.862),优于拉普拉斯机制,表明其在中等隐私需求下更具优势。
  • 在ε=1时,PRS机制的成功率为0.85,而拉普拉斯机制为0.80,表明PRS在低隐私保护场景下更具优势。
  • 采用|B|=100缓冲的PRS机制显著提升了训练稳定性,相比无缓冲情况,尤其在高噪声环境下实现了更优的学习性能。
  • 在ε=2时,PRS的首次成功时间(FST)中位数为7,549,显著低于拉普拉斯的20,238.5,表明该设置下收敛速度更快。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。