Skip to main content
QUICK REVIEW

[논문 리뷰] Approximate information state for approximate planning and reinforcement learning in partially observed systems

Jayakumar Subramanian, Amit Kumar Sinha|arXiv (Cornell University)|2020. 10. 17.
Receptor Mechanisms and Signaling인용 수 31
한 줄 요약

이 논문은 부분적으로 관찰 가능한 시스템에서 계획 및 강화 학습을 위한 근사 정보 상태(AIS)의 엄밀한 프레임워크를 개발하고, 성능 상한을 도출하며, AIS가 많은 알려진 근사를 포괄하고 AIS 기반 정책 그래디언트 방법을 다중 시간 규모 학습과 함께 제시하며 실험으로 검증합니다.

ABSTRACT

We propose a theoretical framework for approximate planning and learning in partially observed systems. Our framework is based on the fundamental notion of information state. We provide two equivalent definitions of information state -- i) a function of history which is sufficient to compute the expected reward and predict its next value; ii) equivalently, a function of the history which can be recursively updated and is sufficient to compute the expected reward and predict the next observation. An information state always leads to a dynamic programming decomposition. Our key result is to show that if a function of the history (called approximate information state (AIS)) approximately satisfies the properties of the information state, then there is a corresponding approximate dynamic program. We show that the policy computed using this is approximately optimal with bounded loss of optimality. We show that several approximations in state, observation and action spaces in literature can be viewed as instances of AIS. In some of these cases, we obtain tighter bounds. A salient feature of AIS is that it can be learnt from data. We present AIS based multi-time scale policy gradient algorithms. and detailed numerical experiments with low, moderate and high dimensional environments.

연구 동기 및 목표

  • Performance 평가 및 동적 프로그래밍에 충분한 히스토리의 통계로 정보 상태를 형식화한다.
  • 이 속성을 근사 보존하는 압축된 히스토리로서 AIS를 도입한다.
  • AIS 기반의 계획이 최적 정책에 비해 손실이 한정되어 있음을 보이는 한계를 도출한다.
  • AIS가 상태, 관찰, 행동 공간의 기존 근사를 포괄하고 데이터를 통해 학습될 수 있음을 보인다.
  • 독립적 다에이전트 환경으로 AIS를 확장하고 AIS 기반 온라인 정책 그래디언트 알고리즘을 개발한다.

제안 방법

  • 두 가지 등가 조건(P1: 성능 평가에 충분성, P2: 미래 통계를 예측하는 충분성)을 통해 정보 상태를 정의하고, 등가적 동적 프로그래밍 분해를 제공한다.
  • AIS를 P1 및 P2를 대략적으로 만족하는 히스토리의 압축으로 제안하고, AIS 하에서의 성능 손실에 대한 상한을 도출한다.
  • 두 정보 상태 정의에 대응하는 두 가지 등가 AIS 표현을 제시하여 두 개의 병렬 DP 구성을 가능하게 한다.
  • 공동 정보에 기반한 AIS를 사용하여 분산된(다에이전트) 시스템의 근사적 행동 공간으로 프레임워크를 확장한다.
  • 다중 시간 규모의 확률적 최적화로 AIS 표현을 학습하는 AIS 기반 정책 그래디언트 알고리즘을 개발한다.
  • AIS가 정보 상태 속성에 대한 근사치를 덜 벗어나면 AIS 기반 정책이 거의 최적에 가깝다는 이론적 결과를 제공한다.

실험 결과

연구 질문

  • RQ1정보 상태란 무엇이며 부분적으로 관찰 가능한 시스템에서 동적 프로그래밍을 어떻게 가능하게 하는가?
  • RQ2히스토리를 압축하면서도 거의 최적의 계획 성능을 보존하는 근사 정보 상태(AIS)를 어떻게 정의하고 정량화할 수 있는가?
  • RQ3정확한 정보 상태 대신 AIS를 사용할 때의 성능 손실 한계는 무엇인가?
  • RQ4상태, 관찰, 행동 공간의 기존 근사를 AIS 인스턴스로 볼 수 있으며 더 강한 보장을 제공하는가?
  • RQ5데이터로 AIS를 학습하고 다에이전트 환경을 포함한 PORL(온라인 정책 그래디언트) 알고리즘 설계에 AIS를 어떻게 활용할 수 있는가?

주요 결과

  • AIS는 근사적 동적 프로그래밍을 가능하게 하는 히스토리의 원칙적인 압축을 제공하며 최적성과의 차손실이 유한한 정책을 도출한다.
  • 상태, 관찰, 행동 공간의 많은 기존 근사화가 AIS의 특수한 경우이며 몇몇 경우에 더 타이트한 한계가 제공된다.
  • 데이터로 AIS를 학습할 수 있어 성능 저하에 대한 이론적 보장을 갖춘 데이터 기반 PORL이 가능하다.
  • 공동 정보를 기반으로 하는 AIS를 사용하는 분산 시스템으로 프레임워크를 확장함으로써 다에이전트 PORL 분석이 가능하다.
  • 다중 학습 시간 규모를 갖춘 AIS 기반 온라인 정책 그래디언트 방법이 도출되어 다양한 환경에서 검증된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.