[논문 리뷰] Local Environment Poisoning Attacks on Federated Reinforcement Learning
이 논문은 연합 강화학습(Federated Reinforcement Learning, FRL)을 대상으로 한 새로운 국소 환경 오염 공격 프레임워크를 제안한다. 이 공격은 국소 학습 중 관측값을 조작하여 글로벌 정책의 성능을 떨어뜨린다. 공격를 최적화 문제로 수립하고, 비밀 및 공개 크리틱을 사용하여 액터-크리틱 설정으로 확장함으로써 글로벌 목표 함수를 증명 가능하게 감소시키며, 다양한 OpenAI Gym 환경과 강화학습 알고리즘에서 뛰어난 오염 효과를 보이며 기존 기준 공격을 능가한다.
Federated learning (FL) has become a popular tool for solving traditional Reinforcement Learning (RL) tasks. The multi-agent structure addresses the major concern of data-hungry in traditional RL, while the federated mechanism protects the data privacy of individual agents. However, the federated mechanism also exposes the system to poisoning by malicious agents that can mislead the trained policy. Despite the advantage brought by FL, the vulnerability of Federated Reinforcement Learning (FRL) has not been well-studied before. In this work, we propose a general framework to characterize FRL poisoning as an optimization problem and design a poisoning protocol that can be applied to policy-based FRL. Our framework can also be extended to FRL with actor-critic as a local RL algorithm by training a pair of private and public critics. We provably show that our method can strictly hurt the global objective. We verify our poisoning effectiveness by conducting extensive experiments targeting mainstream RL algorithms and over various RL OpenAI Gym environments covering a wide range of difficulty levels. Within these experiments, we compare clean and baseline poisoning methods against our proposed framework. The results show that the proposed framework is successful in poisoning FRL systems and reducing performance across various environments and does so more effectively than baseline methods. Our work provides new insights into the vulnerability of FL in RL training and poses new challenges for designing robust FRL algorithms
연구 동기 및 목표
- 악성 에이전트에 의한 오염 공격에 대한 연합 강화학습(FRL)의 취약성을 체계적으로 조사하기 위해.
- FRL에서 국소 환경 오염을 최적화 문제로 모델링하는 일반화 가능한 프레임워크를 개발하기 위해.
- 정책 기반 FRL에 효과적인 실용적 오염 프로토콜을 설계하고, 액터-크리틱 아키텍처로 확장 가능하도록 하기 위해.
- 다양한 RL 환경과 알고리즘을 대상으로 공격의 효과성을 실증적으로 검증하기 위해.
- FRL의 보안 위험을 부각하고 더 강력한 방어 메커니즘 개발을 촉진하기 위해.
제안 방법
- 악성 에이전트는 국소 학습 중 관측값을 조작하여 글로벌 정책를 오도하는 방식으로 국소 환경 오염을 최적화 문제로 모델링한다.
- 정책 기반 FRL에서는 진짜 MDP에 접근하지 못한 채 관측값에 적대적 편향을 주입하여 국소 학습 데이터를 조작한다.
- 액터-크리틱 설정에서는 공격자가 비밀 및 공개 크리틱 쌍을 훈련시켜 가치 함수 추정치를 왜곡하고 글로벌 모델 업데이트를 조작한다.
- 이 프레임워크는 이론적으로 증명된 바와 같이 오염이 글로벌 목표 함수를 엄격히 악화시킴을 보장한다.
- 200회의 통신 라운드 동안 모델 평균화 및 글로벌 모델 브로드캐스트를 사용하는 표준 연합 학습 프rotocol을 통해 공격를 평가한다.
- 제거 분석은 제안된 방법을 정상 학습과 무작위 보상 기반 공격과 비교하여 표적 관측 오염의 영향을 고립한다.
실험 결과
연구 질문
- RQ1국소 환경 오염은 FRL에서 증명 가능하게 효과적인 최적화 문제로 공식화될 수 있는가?
- RQ2제안된 오염 방법은 다양한 RL 환경에서 글로벌 정책 성능을 얼마나 효과적으로 떨어뜨리는가?
- RQ3가치 함수 조작을 통한 액터-크리틱 FRL로 확장했을 때도 공격는 여전히 효과적인가?
- RQ4악성 에이전트의 비율이 오염 공격 성공에 미치는 영향은 어떠한가?
- RQ5무작위 보상 편향 공격과 같은 기준 공격에 비해 제안된 방법은 어떻게 비교되는가?
주요 결과
- 제안된 오염 방법은 CartPole, InvertedPendulum, LunarLander, Hopper, Walker2d, HalfCheetah 등 테스트한 모든 환경에서 글로벌 정책 성능을 효과적으로 떨어뜨린다.
- VPG 기반 시스템에서는 무작위 보상 기반 공격보다 공격 성능이 뛰어나며, CartPole에서 뚜렷한 성능 저하와 일관된 평균 에피소드 보상 감소가 관찰된다.
- PPO 기반 시스템에서는 기울기 노이즈가 감소하여 보상 오염이 더 효과적으로 작용하고 정책 조작이 강력해지므로 공격 성능이 뛰어나다.
- 악성 에이전트 비율이 작더라도 공격는 효과적이며, 확장성과 은폐성(스텔스성)을 입증한다.
- 이 방법은 글로벌 목표 함수를 증명 가능하게 악화시키며, 이론적 타당성과 체계적 영향을 확인한다.
- 결과는 FRL이 국소 환경 오염에 취약하며, 실세계 적용에 있어 심각한 위험을 안고 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.