Skip to main content
QUICK REVIEW

[논문 리뷰] Locally Private Distributed Reinforcement Learning

Hajime Ono, Tsubasa Takahashi|arXiv (Cornell University)|2020. 01. 31.
Privacy-Preserving Technologies in Data참고 문헌 27인용 수 19
한 줄 요약

이 논문은 국소적 미분적 비밀유지(Loacl Differential Privacy, LDP)를 만족시키기 위해 라플라스 또는 PRS 기반의 노이즈 주입을 통해 기울기를 보호함으로써, 비밀유지 환경 간에 강력한 정책 학습을 가능하게 하는 새로운 프레임워크인 사생활 보장 기반 기울기 수집(PGC)을 제안한다. PGC는 에이전트가 기울기 업데이트를 기여함으로써 개인 정보를暴露하지 않도록 하면서도, LDP 조건 하에서도 효과적인 학습 성능 유지를 보장하여 강력한 비밀유지 보장을 달성한다.

ABSTRACT

We study locally differentially private algorithms for reinforcement learning to obtain a robust policy that performs well across distributed private environments. Our algorithm protects the information of local agents' models from being exploited by adversarial reverse engineering. Since a local policy is strongly being affected by the individual environment, the output of the agent may release the private information unconsciously. In our proposed algorithm, local agents update the model in their environments and report noisy gradients designed to satisfy local differential privacy (LDP) that gives a rigorous local privacy guarantee. By utilizing a set of reported noisy gradients, a central aggregator updates its model and delivers it to different local agents. In our empirical evaluation, we demonstrate how our method performs well under LDP. To the best of our knowledge, this is the first work that actualizes distributed reinforcement learning under LDP. This work enables us to obtain a robust agent that performs well across distributed private environments.

연구 동기 및 목표

  • 국소 정책이 비밀유지 환경에서 비밀 정보를 의도하지 않게 유출하는 문제를 해결하기 위해.
  • 비밀유지 환경에서 기여하는 에이전트가 보고하는 기울기에 대해 국소적 미분적 비밀유지(LDP)를 보장하는 DRL 프레임워크를 설계하기 위해.
  • 에이전트 수준의 비밀유지가 훼손되지 않도록 다양한 비밀유지 환경 간에 강력한 정책 학습을 가능하게 하기 위해.
  • 실제 DRL 환경에서 비밀유지(ε로 제어됨)와 학습 효율성 간의 상호작용을 평가하기 위해.

제안 방법

  • 국소 에이전트가 비밀유지 환경에서 모델을 훈련하고, 중앙 집중형 집계자에게 LDP 보호를 받은 노이즈가 첨가된 기울기를 보고하는 사생활 보장 기반 기울기 수집(PGC) 프레임워크를 제안한다.
  • 라플라스 및 PRS(Poisson Rejection Sampling) 기반의 두 가지 랜덤화 기법을 활용하여 기울기에 노이즈를 주입함으로써 국소적 미분적 비밀유지를 보장한다.
  • 기본 알고리즘으로 비동기적 이점이 있는 액터-크리틱(A3C)을 사용하며, 기울기 보고 방식을 수정하여 비밀유지 보장을 유지하면서도 학습 안정성을 확보한다.
  • PRS에서 버퍼링 메커니즘을 도입하여 기울기 안정성을 향상시켜, 노이즈로 인한 훈련 불안정성을 감소시킨다.
  • 중앙 집중형 집계자는 보고된 노이즈가 첨가된 기울기를 사용하여 글로벌 모델을 업데이트함으로써, 다양한 환경 간에 강력한 정책 학습을 가능하게 한다.
  • 비밀유지 예산 ε를 도입하여 미분적 비밀유지 수준을 제어하며, 낮은 ε 값은 더 강력한 비밀유지를 의미한다.

실험 결과

연구 질문

  • RQ1비밀유지 환경에서 훈련된 국소 정책으로부터 발생하는 비밀유지 누출 문제를 해결할 수 있는 분산 강화학습 기반 기술이 가능한가?
  • RQ2원시 데이터 전송 없이도 DRL 환경에서 기울기에 대해 국소적 미분적 비밀유지(LDP)를 효과적으로 적용할 수 있는가?
  • RQ3다른 노이즈 주입 기법(Laplace 대비 PRS)이 DRL 환경에서 학습 효율성과 비밀유지-유용성 균형에 어떤 영향을 미치는가?
  • RQ4비밀유지 예산 ε의 선택이 LDP 조건 하에서 학습 성공률과 수렴 속도에 어떤 영향을 미치는가?

주요 결과

  • PRS 기반의 PGC-A3C는 ε=2일 때 성공 비율 0.95를 기록하여 라플라스 기반 대비 0.90보다 높게 나타나, 강력한 비밀유지 조건 하에서도 초기 학습 성능이 뛰어나다는 것을 보여준다.
  • 라플라스 기법은 ε=10일 때 상대적 AUC 0.965를 달성하여 비공개 기준(AUC=1.0)에 근접함으로써, 비밀유지 조건이 느슨할 경우 뛰어난 학습 효율성을 보인다.
  • PRS 기법은 ε=2일 때 상대적 AUC 0.862를 기록하여, 이 비밀유지 수준에서 라플라스 기법을 능가함으로써 중간 수준의 비밀유지 요구 조건에 더 효과적임을 시사한다.
  • ε=1일 때, PRS 기법은 성공 비율 0.85를 기록하였고, 라플라스 기법은 0.80을 기록하여, 낮은 비밀유지 수준에서 PRS의 우월성을 입증한다.
  • |B|=100 버퍼링을 적용한 PRS 기법은 훈련 안정성을 향상시켜, 특히 높은 노이즈 조건에서 버퍼링 없이 대비 더 나은 학습 성능을 달성한다.
  • ε=2일 때 PRS의 FST(median)는 7,549로, 라플라스 기법의 20,238.5보다 유의미하게 낮게 나타나, 이 설정 하에서 더 빠른 수렴을 보임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.