Skip to main content
QUICK REVIEW

[논문 리뷰] Finite-Sample Analysis of Decentralized Temporal-Difference Learning with Linear Function Approximation

Jun Sun, Gang Wang|arXiv (Cornell University)|2019. 11. 03.
Reinforcement Learning in Robotics참고 문헌 30인용 수 7
한 줄 요약

이 논문은 마르코프 데이터 하에서 선형 함수 근사와 함께 분산형 시간차분(TD) 학습의 최초 유한 표본 분석을 제시하며, 다단계 리아푸노프 함수를 통해 최적의 가치 함수 근처의 작은 이웃으로 선형 수렴를 확립한다. 분석은 i.i.d. 및 마르코프 표본을 모두 포함하며, 추가적인 투영 단계 없이 기울기 편향 문제를 해결한다.

ABSTRACT

Motivated by the emerging use of multi-agent reinforcement learning (MARL) in engineering applications such as networked robotics, swarming drones, and sensor networks, we investigate the policy evaluation problem in a fully decentralized setting, using temporal-difference (TD) learning with linear function approximation to handle large state spaces in practice. The goal of a group of agents is to collaboratively learn the value function of a given policy from locally private rewards observed in a shared environment, through exchanging local estimates with neighbors. Despite their simplicity and widespread use, our theoretical understanding of such decentralized TD learning algorithms remains limited. Existing results were obtained based on i.i.d. data samples, or by imposing an `additional' projection step to control the `gradient' bias incurred by the Markovian observations. In this paper, we provide a finite-sample analysis of the fully decentralized TD(0) learning under both i.i.d. as well as Markovian samples, and prove that all local estimates converge linearly to a small neighborhood of the optimum. The resultant error bounds are the first of its type---in the sense that they hold under the most practical assumptions ---which is made possible by means of a novel multi-step Lyapunov analysis.

연구 동기 및 목표

  • 현실적인 마르코프 데이터 하에서 분산형 TD(0) 학습에 대한 유한 표본 수렴 보장이 부족한 문제를 해결한다.
  • 시간에 따라 상관관계가 있는 데이터로 인해 분산형 TD 학습에서 기울기 편향이 크게 발생하는 문제를 극복한다.
  • 추가적인 투영 단계 없이도 실용적인 가정 하에서 유효한 수렴 범위를 제공한다.
  • i.i.d. 및 마르코프 설정 모두에서 최적 매개수의 작은 이웃으로 선형 수렴를 확립한다.
  • 분산형 TD(0) 동역학의 비점근적 분석을 가능하게 하는 새로운 다단계 리아푸노프 함수를 개발한다.

제안 방법

  • 에이전트들이 이웃과 국소 매개수 추정치를 교환하고 국소 보상값을 사용해 업데이트하는 완전히 분산된 TD(0) 알고리즘을 제안한다.
  • 다단계 리아푸노프 함수를 도입하여 다수의 시간 단계에 걸친 오차 동역학을 분석하고, 매개수 추정치의 변화를 포착한다.
  • 마르코프 설정에서의 기울기 편향을 분석하기 위해 이중 단계 분해(Phase I: 비정상성, Phase II: 정상성 향한 혼합)를 사용한다.
  • 행렬 노름과 고유값 성질을 이용해 국소 추정치가 최적 매개수에서의 기대 제곱편차를 유한 표본 오차 경계로 제한한다.
  • 동역학 시스템 관점과 ODE 근사법을 사용하여 이산 시간 업데이트를 연속 시간 궤적과 연결한다.
  • 적절히 선택된 스텝 사이즈 및 네트워크 구조 매개수를 통해 오차 항의 감쇠를 통제함으로써 수렴 속도를 확립한다.

실험 결과

연구 질문

  • RQ1마르코프 데이터 하에서 i.i.d. 가정에 의존하지 않고도 분산형 TD(0) 학습에 대한 유한 표본 수렴를 확립할 수 있는가?
  • RQ2시간에 따라 상관관계가 있는 표본이 분산형 TD(0) 학습의 수렴에 미치는 기울기 편향은 어떠한가?
  • RQ3편향을 제어하기 위해 추가적인 투영 단계 없이도 최적 해 근처의 작은 이웃으로 선형 수렴를 달성할 수 있는가?
  • RQ4네트워크 구조와 혼합 시간은 선형 함수 근사와 함께 분산형 TD(0)의 수렴 속도에 어떤 역할을 하는가?
  • RQ5분산 설정에서 i.i.d. 및 마르코프 표본 방식 간 오차 경계는 어떻게 다를까?

주요 결과

  • 제안된 분산형 TD(0) 알고리즘은 i.i.d. 및 마르코프 데이터 모두에서 최적 매개수의 작은 이웃으로 선형 수렴를 보인다.
  • 마르코프 케이스의 오차 경계는 이중 단계 구조를 가진다: Phase I(비정상성)에서는 일정한 이웃 크기, Phase II(혼합)에서는 기울기 편향 감소로 인해 기하급수적 감쇠를 보인다.
  • 최종 이웃 크기는 $\frac{2c_5c_8'}{K_{\mathcal{G}}\lambda_{\rm max}^{\bar{\bm{H}}}}\alpha + \min\{1, c_7^{k-k_\alpha}\}(\alpha^2 c_6 - \frac{2c_5c_8'}{K_{\mathcal{G}}\lambda_{\rm max}^{\bar{\bm{H}}}})$로 유계이며, 마르코프 체인이 혼합된 후 기하급수적으로 감소한다.
  • 수렴 속도는 선형이며, 오차는 $c_9^k V_0'$로 감쇠한다. 여기서 $c_9 = \max\{ (\lambda_2^{\bm{W}} + 2\alpha_{\rm max})^2, c_7 \}$이며, 지수 감쇠를 나타낸다.
  • 분석은 마르코프 관측치 하에서 추가적인 투영 단계 없이도 분산형 TD(0)에 대한 최초의 유한 표본 오차 경계를 제공한다.
  • 100개 상태와 10차원 매개수를 가진 30에이전트 네트워크에서의 시뮬레이션은 평균 매개수의 선형 수렴와 에이전트 간의 공감을 확인하여 이론적 결과를 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.