Skip to main content
QUICK REVIEW

[논문 리뷰] Unbiased Asymmetric Reinforcement Learning under Partial Observability

Andrea Baisero, Christopher Amato|arXiv (Cornell University)|2021. 05. 25.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 부분 관측 강화 학습를 위한 편향 없는 비대칭 액터-크리틱 방법을 제안하며, 상태 기반 크리틱 $V^\pi(s)$ 대신 역사-상태 가치 함수 $\hat{V}(h,s)$ 를 사용함으로써 이전의 편향된 접근 방식의 이론적 결함을 해결한다. 이 방법은 정책 기울기의 타당성을 보장하고 학습 편향을 줄이며, 메모리 집약적이고 부분 관측적인 환경인 Heaven-Hell-4와 Memory-Four-Rooms-9x9에서 대칭 및 편향된 비대칭 기준선보다 더 빠른 수렴 속도와 더 나은 성능을 달성한다.

ABSTRACT

In partially observable reinforcement learning, offline training gives access to latent information which is not available during online training and/or execution, such as the system state. Asymmetric actor-critic methods exploit such information by training a history-based policy via a state-based critic. However, many asymmetric methods lack theoretical foundation, and are only evaluated on limited domains. We examine the theory of asymmetric actor-critic methods which use state-based critics, and expose fundamental issues which undermine the validity of a common variant, and limit its ability to address partial observability. We propose an unbiased asymmetric actor-critic variant which is able to exploit state information while remaining theoretically sound, maintaining the validity of the policy gradient theorem, and introducing no bias and relatively low variance into the training process. An empirical evaluation performed on domains which exhibit significant partial observability confirms our analysis, demonstrating that unbiased asymmetric actor-critic converges to better policies and/or faster than symmetric and biased asymmetric baselines.

연구 동기 및 목표

  • 부분 관측 환경에서 상태 기반 크리틱 $V^\pi(s)$ 를 사용하는 기존 비대칭 액터-크리틱 방법에 내재된 이론적 결함을 규명하는 것.
  • 잠재 상태 정보를 명시적으로 통합함으로써 부분 관측 하에서 비대칭 액터-크리틱 방법에 대한 엄밀한 정책 기울기 정리 수립.
  • 역사-상태 쌍 $(h,s)$ 를 크리틱의 입력으로 사용함으로써 편향 없는 비대칭 액터-크리틱의 새로운 변형 설계.
  • 고도로 부분 관측적인 환경에서 이론적 주장의 실증적 검증을 통해 대칭 및 편향된 비대칭 기준선 대비 뛰어난 수렴 속도와 성능 확보.
  • 단일 에이전트 및 다중 에이전트 강화 학습을 위한 오프라인 훈련에서 특권 정보의 원칙적인 활용을 위한 기반 마련.

제안 방법

  • 에이전트의 역사 $h$ 와 진짜 시스템 상태 $s$ 를 함께 조건으로 삼는 새로운 크리틱 아키텍처 $\hat{V}^\pi(h,s)$ 를 제안하여, POMDP에서 더 정확한 가치 추정이 가능하도록 한다.
  • 정책 최적화에 $\hat{V}^\pi(h,s)$ 를 사용하는 데 대한 공식적 정당성을 보장하는 새로운 비대칭 정책 기울기 정리 유도.
  • 표준 A2C와 동일한 정책 네트워크를 유지하면서도 역사-상태 크리틱을 사용하는 A2C-asym-hs 알고리즘을 도입.
  • 크리틱의 가치 추정이 관측 가능한 역사를 비롯해 특권 상태에 기반하도록 하는 훈련 목표를 활용하여, 상태 기반 크리틱의 모호성 방지.
  • 크리틱은 역사와 상태 입력을 모두 받는 이중 브랜치 네트워크 구조를 사용하며, 정책은 여전히 역사 기반 유지하여 온라인 실행 제약 조건 유지.
  • 오프-폴리시 경험 리플레이와 표준 A2C 업데이트 규칙을 활용하지만, 가치 함수 타겟을 역사-상태 크리틱으로 수정하여 일관되고 편향 없는 학습 보장.
(a) State.
(a) State.

실험 결과

연구 질문

  • RQ1비대칭 액터-크리틱 방법에서 상태 기반 크리틱 $V^\pi(s)$ 가 부분 관측 환경에서 왜 편향된 학습을 유도하는가?
  • RQ2특권 상태 정보를 통합한 비대칭 액터-크리틱 방법에 대해 이론적으로 타당한 정책 기울기 정리를 도출할 수 있는가?
  • RQ3상태 기반 크리틱 $\hat{V}^\pi(s)$ 대신 역사-상태 크리틱 $\hat{V}^\pi(h,s)$ 를 사용함으로써 POMDP에서 학습 편향이 제거되고 정책 성능이 향상되는가?
  • RQ4제안된 편향 없는 비대칭 방법은 수렴 속도와 최종 정책 품질 측면에서 대칭 A2C 및 편향된 비대칭 기준선과 비교해 어떻게 다른가?
  • RQ5제안된 방법은 A2C를 초월한 다른 크리틱 기반 딥 강화 학습 알고리즘으로 일반화될 수 있는가?

주요 결과

  • 다양한 역사가 동일한 상태로 매핑될 수 있기 때문에, POMDP에서 상태 기반 크리틱 $\hat{V}^\pi(s)$ 는 본질적으로 정의되지 않으며, 이는 모호한 가치 추정과 학습 편향을 초래한다.
  • 역사 $h$ 와 상태 $s$ 를 모두 조건으로 삼는 A2C-asym-hs 크리틱은 동일한 상태일지라도 다른 역사를 가진 경우에 서로 다른 가치 출력을 생성하여 적절한 책임 할당이 가능하다.
  • Heaven-Hell-4 환경에서 A2C-asym-hs 크리틱은 이전에 고위성에게 방문한 상태에 대해 더 높은 가치를 할당하여 정보 수집 행동의 중요성을 잘 반영한다.
  • 실증 결과로, A2C-asym-hs는 Memory-Four-Rooms-9x9와 Heaven-Hell-4에서 대칭 A2C 및 편향된 비대칭 기준선보다 더 빠른 수렴 속도와 더 높은 최종 수익을 달성한다.
  • 편향된 A2C-asym-s 크리틱은 동일한 상태이지만 다른 역사를 가진 경우에도 동일한 가치를 출력하여 학습을 약화시키지만, A2C-asym-hs는 런에 걸쳐 일관된 가치 추정을 유지한다.
  • 제안된 방법은 부분 관측 하에서 정책 기울기 정리의 타당성을 유지하는 이론적으로 탄탄한 편향 없는 비대칭 액터-크리틱 프레임워크를 제공하는 최초의 방법이다.
(b) Observation.
(b) Observation.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.