Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Stochastic Approximation under Markov Noise and Heterogeneity: Applications in Reinforcement Learning

Sajad Khodadadian, Pranay Sharma|arXiv (Cornell University)|2022. 06. 21.
Privacy-Preserving Technologies in Data인용 수 13
한 줄 요약

이 논문은 마르코프 노이즈와 다중 로컬 업데이트 조건 하에서 에이전트 수에 비례하여 선형 수렴 속도 향상을 달성하는 온-폴리시 TD, 오프-폴리시 TD, Q-러닝을 위한 피어드 강화학습 알고리즘을 제안한다. 이는 현실적인 마르코프 설정에서 이러한 알고리즘에 대한 최초의 수렴 분석을 수립하며, 선형 속도 향상과 통신 빈도의 영향을 규명한다.

ABSTRACT

Since reinforcement learning algorithms are notoriously data-intensive, the task of sampling observations from the environment is usually split across multiple agents. However, transferring these observations from the agents to a central location can be prohibitively expensive in terms of communication cost, and it can also compromise the privacy of each agent's local behavior policy. Federated reinforcement learning is a framework in which $N$ agents collaboratively learn a global model, without sharing their individual data and policies. This global model is the unique fixed point of the average of $N$ local operators, corresponding to the $N$ agents. Each agent maintains a local copy of the global model and updates it using locally sampled data. In this paper, we show that by careful collaboration of the agents in solving this joint fixed point problem, we can find the global model $N$ times faster, also known as linear speedup. We first propose a general framework for federated stochastic approximation with Markovian noise and heterogeneity, showing linear speedup in convergence. We then apply this framework to federated reinforcement learning algorithms, examining the convergence of federated on-policy TD, off-policy TD, and $Q$-learning.

연구 동기 및 목표

  • 실제 마르코프 샘플링과 로컬 업데이트 조건 하에서 피어드 강화학습에서 선형 수렴 속도 향상을 달성하는 데 도전하는 것.
  • 비.i.i.d. 마르코프 노이즈 하에서 선형 함수 근사와 함께 피어드 TD-러닝 및 Q-러닝을 분석하는 것.
  • 에이전트 수와 동기화 빈도 K 둘 다를 고려한 수렴 범위를 수립하는 것.
  • 마르코프 노이즈 하에서 피어드 확률적 근사의 통합 이론적 프레임워크를 제공하는 것.
  • 피어드 RL에서의 통신 효율성과 수렴 스케일링에 대한 열린 질문을 해결하는 것.

제안 방법

  • 에이전트가 온-폴리시 샘플을 사용하여 로컬 모델을 업데이트하고 모델 파라미터만 공유하는 선형 함수 근사를 적용한 피어드 온-폴리시 TD-러닝 알고리즘을 제안한다.
  • 목표 정책와 다른 행동 정책를 사용할 수 있는 피어드 오프-폴리시 TD 및 Q-러닝 알고리즘을 도입하여 프라이버시를 유지한다.
  • 마르코프 노이즈 하에서 피어드 확률적 근사를 위한 일반적 프레임워크를 개발하여 통합된 수렴 분석을 가능하게 한다.
  • 비.i.i.d. 데이터를 다루기 위해 가중치 노름과 리아푸노프 함수를 통합한 새로운 분석 기법을 기반으로 한 FedSAM 알고리즘을 활용한다.
  • 통신 빈도 K, 스텝 사이즈 α, 혼합 시간 τ의 영향을 분석하여 수렴 범위를 유도한다.
  • p-노름의 노름 등가성과 부드러움 성질을 활용하여 상태 공간 크기 |S|, 할인 요소 γ, 최소 상태 방문 확률 μ_min 에 기반한 수렴 속도의 상한을 유도한다.

실험 결과

연구 질문

  • RQ1마르코프 샘플링 조건 하에서 피어드 RL에서 NewA 에이전트를 사용할 경우 수렴 속도가 에이전트 수에 비례하여 N배 선형적으로 향상되는가?
  • RQ2동기화 빈도 K 가 피어드 Q-러닝 및 TD-러닝의 수렴 속도와 최종 오차에 어떤 영향을 미치는가?
  • RQ3이전 연구에서 i.i.d. 노이즈 가정이 있었던 것과는 달리, 마르코프 노이즈와 다중 로컬 업데이트 조건 하에서도 선형 속도 향상을 확립할 수 있는가?
  • RQ4통신 빈도 K 는 피어드 RL에서 수렴 속도와 통신 비용을 균형 잡는 데 어떤 역할을 하는가?
  • RQ5마르코프 노이즈 하에서 여러 피어드 RL 알고리즘의 수렴을 분석하기 위한 통합 이론적 프레임워크를 개발할 수 있는가?

주요 결과

  • 논문은 마르코프 노이즈 하에서 피어드 TD 및 Q-러닝에 대해 에이전트 수에 비례하는 선형 수렴 속도 향상을 증명하였으며, 이는 이전에 확립되지 않은 결과이다.
  • 수렴 속도는 시간 t 에 대해 O(1/t) 스케일을 가지며, 상수 요소는 에이전트 수에 비례하여 향상된다.
  • 분석 결과, 동기화 빈도 K 를 높일수록 수렴이 향상되지만, 일정 수준 이상에서는 수익 감소 현상이 나타나며, 더 이상 유의미한 향상이 없다.
  • 수렴 상한은 μ_min(1−γ) 에 의존하며, 혼합이 잘 되지 않는 마르코프 체인이 학습 속도를 저하시킨다.
  • 표본 복잡도는 보조정리 B.1.1을 사용하여 유도되었으며, 표본 수가 에이전트 수에 비례하고 혼합 시간의 역수에 비례하여 유리하게 스케일링됨을 보여준다.
  • 프레임워크는 피어드 Q-러닝 및 TD-러닝이 마르코프 노이즈 하에서 일반적인 피어드 확률적 근사 알고리즘의 특수한 경우임을 규명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.