Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Reinforcement Learning with Environment Heterogeneity

Hao Jin, Peng Yang|arXiv (Cornell University)|2022. 04. 06.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

이 논문은 환경 간 이질성이 있는 설정에서 에이전트들이 경험을 공유하지 않고도 공통 정책을 학습할 수 있도록 하는 QAvg 및 PAvg라는 분산 강화학습 알고리즘을 제안한다. 환경 임베딩을 활용한 개인화 히ュ리스틱을 도입하여 국지적 성능를 향상시키고, 새로운 환경으로의 빠른 적응을 가능하게 하며, 이론적 수렴 분석을 통해 최적성의 열등성은 환경 이질성에 비례함을 밝힌다.

ABSTRACT

We study a Federated Reinforcement Learning (FedRL) problem in which $n$ agents collaboratively learn a single policy without sharing the trajectories they collected during agent-environment interaction. We stress the constraint of environment heterogeneity, which means $n$ environments corresponding to these $n$ agents have different state transitions. To obtain a value function or a policy function which optimizes the overall performance in all environments, we propose two federated RL algorithms, exttt{QAvg} and exttt{PAvg}. We theoretically prove that these algorithms converge to suboptimal solutions, while such suboptimality depends on how heterogeneous these $n$ environments are. Moreover, we propose a heuristic that achieves personalization by embedding the $n$ environments into $n$ vectors. The personalization heuristic not only improves the training but also allows for better generalization to new environments.

연구 동기 및 목표

  • 다양한 상태 전이를 가진 환경에서 작동하는 다수의 에이전트가 경험을 공유하지 않고도 동일한 정책을 균일하게 효과적으로 학습하는 문제를 해결한다.
  • 환경 이질성이 존재하는 상황에서 분산 강화학습 알고리즘의 수렴성과 최적성 열등성에 대해 이론적 분석을 수행한다.
  • 원시 경험을 공유하지 않고도 에이전트가 개별 환경에 맞게 공유된 정책을 적응시킬 수 있는 개인화 메커니즘을 개발한다.
  • 환경 임베딩의 경량적 적응을 통해 훈련된 모델을 새로운, 이전에 보지 못한 환경으로 일반화할 수 있도록 한다.

제안 방법

  • 환경 이질성 하에서의 수렴 분석을 수행하는 모델리스 분산 강화학습 알고리즘인 QAvg 및 PAvg를 제안하며, 국지적 정책 업데이트와 글로벌 모델 평균화를 수행한다.
  • 딥 Q네트워크(DQNAvg)와 딥 디터미니스틱 정책 그라디언트(DDPGAvg)를 활용해 QAvg 및 PAvg를 딥 강화학습으로 확장함으로써 복잡한 제어 과제에의 적용 가능성을 높인다.
  • 각 환경에 대한 저차원 벡터인 환경 임베딩을 도입하여 고유한 상태 전이 동역학을 캡처하고 개인화를 가능하게 한다.
  • 모델 평균화를 분리함: 글로벌 평균화 과정에서 환경 임베딩 레이어를 제외하여 환경 특화된 특징를 유지하면서도 핵심 정책 네트워크는 공유한다.
  • 공유된 정책 네트워크를 고정한 채로 환경 임베딩 레이어만 미세조정하여 새로운 환경으로의 빠른 적응을 가능하게 한다.
  • 표현형 평가를 통해 타블라르 및 딥 강화학습 환경에서 수렴성, 성능 및 일반화 능력을 검증한다.

실험 결과

연구 질문

  • RQ1환경 이질성은 분산 강화학습 알고리즘의 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ2다른 상태 전이를 가진 여러 환경에서, 분산 학습을 통해 학습된 단일 공통 정책이 균일하게 양호한 성능을 달성할 수 있는가?
  • RQ3원시 경험을 공유하지 않고도 분산 강화학습에서 얼마나 높은 수준의 개인화를 달성할 수 있으며, 그 효과는 국지적 성능 향상에 얼마나 기여하는가?
  • RQ4학습된 분산 정책은 최소한의 적응으로 새로운 환경으로 일반화될 수 있는가? 가장 효율적인 적응 전략은 무엇인가?

주요 결과

  • QAvg 및 PAvg는 최적해에서 벗어난 해로 수렴하며, 환경 이질성이 높을수록 최적성의 열등성이 커진다.
  • 제안된 DQNAvg 및 DDPGAvg 알고리즘은 독립적 학습 기반보다 훈련 성능이 뛰어나며, 비-분산 변형보다 훈련 및 일반화 성능 모두에서 뛰어나다.
  • 환경 임베딩을 활용한 개인화 히ュ리스틱은 그림 5에서 평균 수익이 높아짐으로써 국지적 훈련 성능 향상이 뚜렷하게 나타남을 보여준다.
  • 환경 임베딩 레이어만 조정하는 방식은 새로운 환경으로의 빠르고 안정적인 일반화를 가능하게 하며, 전체 네트워크 미세조정보다 성능이 뛰어나다 (그림 6).
  • 단지 임베딩 레이어만 조정하면 충분히 적은 업데이트로도 새로운 환경으로의 일반화가 잘 이루어지며, 공유된 정책를 유지할 수 있다.
  • 실험 결과는 경험을 공유하지 않더라도 정책 통신이 국지적 훈련을 가속화함을 확인하여 분산 협업의 이점을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.