Skip to main content
QUICK REVIEW

[논문 리뷰] Asynchronous Policy Evaluation in Distributed Reinforcement Learning over Networks.

Xingyu Sha, Jiaqi Zhang|arXiv (Cornell University)|2020. 03. 01.
Reinforcement Learning in Robotics참고 문헌 46인용 수 8
한 줄 요약

이 논문은 방향성 피어 투 피어 네트워크에서 정책 평가를 위한 완전히 비동기 분산 강화학습 알고리즘을 제안하며, 새로운 SAG 기반 방법과 푸시-풀 증강 그래프를 사용하여 어떤 노드가 업데이트하든 간에 정확한 선형 수렴 속도 𝒪(c^k)를 달성한다. 이 방법은 지연된 이웃 정보를 사용하여 국소적이고 언제라도 가능한 가치 함수 업데이트를 가능하게 하여 선형 속도 향상과 느린 노드에 대한 강건성을 확보한다.

ABSTRACT

This paper proposes a \emph{fully asynchronous} scheme for the policy evaluation problem of distributed reinforcement learning (DisRL) over directed peer-to-peer networks. Without waiting for any other node of the network, each node can locally update its value function at any time by using (possibly delayed) information from its neighbors. This is in sharp contrast to the gossip-based scheme where a pair of nodes concurrently update. Though the fully asynchronous setting involves a difficult multi-timescale decision problem, we design a novel stochastic average gradient (SAG) based distributed algorithm and develop a push-pull augmented graph approach to prove its exact convergence at a linear rate of $\mathcal{O}(c^k)$ where $c\in(0,1)$ and $k$ increases by one no matter on which node updates. Finally, numerical experiments validate that our method speeds up linearly with respect to the number of nodes, and is robust to straggler nodes.

연구 동기 및 목표

  • 신뢰할 수 없거나 지연되는 통신이 있는 방향성 피어 투 피어 네트워크에서 분산 강화학습의 정책 평가 과제를 해결한다.
  • 모든 노드가 조율 없이 또는 동기화 없이 자체 가치 함수를 독립적이고 비동기적으로 업데이트할 수 있도록 한다.
  • 완전히 비동기 환경에서 발생하는 다중 시간 스케일 역학의 본질적 어려움을 극복하여 정확한 수렴을 보장한다.
  • 업데이트 순서나 노드 선택에 관계없이 선형 수렴 속도를 확보한다. 지연된 정보가 존재하더라도 동일하게 유지된다.
  • 실제 분산 환경에서의 확장성과 느린 노드에 대한 강건성을 입증한다.

제안 방법

  • 비동기 정책 평가에 특화된 새로운 확률적 평균 기울기(SAG) 기반 분산 알고리즘을 설계한다.
  • 방향성 네트워크에서의 정보 흐름을 모델링하고 분석하기 위해 푸시-풀 증강 그래프 프레임워크를 도입한다.
  • 각 노드가 이웃의 지연된 데이터를 사용하여 국소적으로 가치 함수를 업데이트할 수 있도록 업데이트 프로세스를 분리한다.
  • 비동기 업데이트와 지연된 기울기를 고려한 리아푸노프 함수를 구성하여 수렴을 보장한다.
  • 푸시-풀 메커니즘을 활용하여 방향성 그래프에서 정보 전파의 균형을 유지한다.
  • 업데이트 순서나 노드 식별자와 무관하게 정확한 선형 수렴 속도 𝒪(c^k)를 증명하며, 여기서 c ∈ (0,1)이다.

실험 결과

연구 질문

  • RQ1동기화 없이 방향성 피어 투 피어 네트워크에서 완전히 비동기 분산 정책 평가 알고리즘이 정확히 수렴할 수 있는가?
  • RQ2지연되고 비동기적인 이웃 정보는 가치 함수 업데이트에 효과적으로 통합될 수 있으며, 이때 수렴이 보장되는가?
  • RQ3이러한 비동기적 방법의 수렴 속도는 무엇이며, 업데이트 순서에 관계없이 여전히 선형인가?
  • RQ4이러한 방법은 네트워크의 노드 수 증가에 따라 어떻게 확장되는가?
  • RQ5느리거나 비정상적으로 업데이트하는 느린 노드에 대해 알고리즘이 얼마나 강건한가?

주요 결과

  • 제안된 알고리즘은 어떤 노드가 업데이트하든 간에 정확한 선형 수렴 속도 𝒪(c^k)를 확보한다. 여기서 c ∈ (0,1)이다.
  • 수렴 속도는 업데이트 순서에 영향을 받지 않아 이질적인 업데이트 빈도 환경에서도 일관된 성능을 보장한다.
  • 수치 실험을 통해 방법이 노드 수에 비례하여 선형적으로 확장됨을 확인하였으며, 분산 환경에서 뛰어난 속도 향상을 보였다.
  • 알고리즘은 느린 노드에 대해 강건성을 유지하여 일부 노드가 느리게 업데이트하더라도 여전히 수렴하고 성능을 유지를 한다.
  • 푸시-풀 증강 그래프 프레임워크는 방향성 통신 토폴로지 문제를 효과적으로 처리하였으며, 비동기 환경에서 정확한 수렴을 가능케 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.