Skip to main content
QUICK REVIEW

[논문 리뷰] A Decentralized Policy Gradient Approach to Multi-task Reinforcement Learning

Sihan Zeng, Aqeel Anwar|arXiv (Cornell University)|2020. 06. 08.
Reinforcement Learning in Robotics참고 문헌 44인용 수 7
한 줄 요약

이 논문은 다양한 환경에서 서로 다른 동역학과 보상을 가진 환경들 간에 공유 정책을 공동으로 학습할 수 있도록, 정책 파ameter만 교환하는 분산형 정책 그래디언트 방법을 제안한다. 이 방법은 표기 설정에서는 유한 시간 내에 정적점에 수렴하고, 구조적 가정 하에 전역 최적 성능을 달성하며, 그리드월드와 대규모 드론 항법 작업 모두에서 효과를 입증한다. 신경망 함수 근사 기법을 사용한다.

ABSTRACT

We develop a mathematical framework for solving multi-task reinforcement learning (MTRL) problems based on a type of policy gradient method. The goal in MTRL is to learn a common policy that operates effectively in different environments; these environments have similar (or overlapping) state spaces, but have different rewards and dynamics. We highlight two fundamental challenges in MTRL that are not present in its single task counterpart, and illustrate them with simple examples. We then develop a decentralized entropy-regularized policy gradient method for solving the MTRL problem, and study its finite-time convergence rate. We demonstrate the effectiveness of the proposed method using a series of numerical experiments. These experiments range from small-scale "GridWorld" problems that readily demonstrate the trade-offs involved in multi-task learning to large-scale problems, where common policies are learned to navigate an airborne drone in multiple (simulated) environments.

연구 동기 및 목표

  • 다양한 동역학과 보상 구조를 가진 여러 환경에서 단일이고 일반화 가능한 정책을 학습하는 데 도전하는 것.
  • 중앙 집중식 조율 없이 에이전트가 정책 파ameter만 공유하는 분산형 통신 프레임워크를 개발하는 것.
  • 제안된 방법의 이론적 수렴 보장을 표기 설정과 신경망 설정 모두에서 제공하는 것.
  • 드론 항법과 같은 대규모 고차원 작업에서의 확장성과 효과성을 입증하는 것.
  • 단일 작업과 다중 작업 강화 학습 간의 근본적 차이를 도식적 예시를 통해 부각하는 것.

제안 방법

  • 에이전트 네트워크 상에서 다중 작업 강화 학습(MTRL)을 분산 최적화 문제로 공식화하며, 각 에이전트는 하나의 작업을 담당한다.
  • 각 작업 간의 탐색과 이용 균형을 확보하기 위해 엔트로피 정규화 정책 그래디언트 업데이트를 사용한다.
  • 에이전트는 순환(링) 통신 그래프를 통해 오직 정책 파ameter만 교환하여 데이터 교환을 최소화한다.
  • 경사 하강법로 그라디언트 추정에는 REINFORCE, A2C 또는 PPO를 사용하고, ADAM 최적화와 몬테카를로 수익 추정을 적용한다.
  • 이론적 분석을 통해 표기 설정에서는 정적점에 수렴하고, 특정 동역학 가정 하에 전역 최적성에 도달함을 보여준다.
  • 고차원 상태 공간을 위해 신경망 정책 함수 근사 기법을 사용하며, 드론 실험에서는 5층의 CNN 아키텍처를 적용한다.

실험 결과

연구 질문

  • RQ1다중 작업 강화 학습에서 분산형 통신은 정책 학습 성능에 어떤 영향을 미치는가?
  • RQ2단일 작업과 다중 작업 강화 학습 간의 근본적 차이점은 무엇이며, 이를 고려한 새로운 알고리즘 설계가 필요한가?
  • RQ3공유 정책 파ameter를 가진 MTRL에서 분산형 정책 그래디언트 방법이 유한 시간 내에 수렴할 수 있는가?
  • RQ4이 방법은 드론 항법과 같은 고차원 실세계 환경에 어떻게 확장될 수 있는가?
  • RQ5어떤 구조적 가정 하에 알고리즘이 전역 최적 정책에 수렴하는가?

주요 결과

  • 분산형 정책 그래디언트 방법은 표기 설정에서 비볼록 성질을 가진 전역 목표 함수의 정적점에 수렴한다.
  • 환경 동역학에 특정한 구조적 가정을 둘 경우, 방법은 전역 최적 정책 값에 수렴한다.
  • 그리드월드 환경에서는 안정적이고 효과적인 다중 작업 성능을 달성하며, 다양한 작업 간의 트레이드오프를 균형 있게 조절한다.
  • 대규모 드론 항법 작업에서는 다양한 조명 조건과 구조를 가진 네 개의 별도 실내 환경에서 공유 정책을 성공적으로 학습한다.
  • 4000 에피소드에 대해 두 대의 RTX2080 GPU에서 약 25시간의 학습 시간이 소요되어 데이터 집약적 작업의 실행 가능성과 타당성을 입증한다.
  • 전체 궤적 데이터 대신 정책 파ameter 교환을 사용함으로써 통신 오버헤드를 줄여 대규모 네트워크에서의 확장성을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.