Skip to main content
QUICK REVIEW

[論文レビュー] Approximate information state for approximate planning and reinforcement learning in partially observed systems

Jayakumar Subramanian, Amit Kumar Sinha|arXiv (Cornell University)|Oct 17, 2020
Receptor Mechanisms and Signaling被引用数 31
ひとこと要約

この論文は、部分的に観測されるシステムにおける計画と強化学習のための厳密な approximate information states (AIS) のフレームワークを開発し、性能境界を導出し、AIS が多くの既知の近似を包含することを示し、AIS に基づくポリシー勾配法を多タイムスケール学習で導入し、実験で検証している。

ABSTRACT

We propose a theoretical framework for approximate planning and learning in partially observed systems. Our framework is based on the fundamental notion of information state. We provide two equivalent definitions of information state -- i) a function of history which is sufficient to compute the expected reward and predict its next value; ii) equivalently, a function of the history which can be recursively updated and is sufficient to compute the expected reward and predict the next observation. An information state always leads to a dynamic programming decomposition. Our key result is to show that if a function of the history (called approximate information state (AIS)) approximately satisfies the properties of the information state, then there is a corresponding approximate dynamic program. We show that the policy computed using this is approximately optimal with bounded loss of optimality. We show that several approximations in state, observation and action spaces in literature can be viewed as instances of AIS. In some of these cases, we obtain tighter bounds. A salient feature of AIS is that it can be learnt from data. We present AIS based multi-time scale policy gradient algorithms. and detailed numerical experiments with low, moderate and high dimensional environments.

研究の動機と目的

  • 情報状態を、性能評価と動的計画法に十分な歴史の統計量として formalize する。
  • これらの性質を概ね保持する圧縮された歴史として、近似情報状態(AIS)を導入する。
  • AIS ベースの計画が最適なポリシーと比較して有界な損失を生じることを示す境界を導出する。
  • AIS が状態・観測・行動空間の既存の近似を包含し、データから学習できることを示す。
  • AIS を分散型マルチエージェント設定に拡張し、AIS ベースのオンラインポリシー勾配アルゴリズムを開発する。

提案手法

  • 情報状態を二つの同等条件で定義する: (P1) 性能評価の十分性、(P2) 将来の統計量を予測する十分性; 同等の動的計画分解を提供する。
  • AIS を、(P1)および(P2)を概ね満たす歴史の圧縮として提案する。AIS に基づく性能損失の境界を導出する。
  • 情報状態の定義に対応する二つの同等の AIS 形式を提示し、二つの並行 DP 構成を可能にする。
  • 共通情報ベースの AIS を用いて、近似的な行動空間および分散化(マルチエージェント)システムへと枠組みを拡張する。
  • マルチタイムスケールの確率的最適化を通じて AIS 表現を学習する AIS ベースのポリシー勾配アルゴリズムを開発する。
  • AIS が情報状態の性質を密接に満たす場合、AIS ベースのポリシーがほぼ最適であることを示す理論的結果を提供する。)

実験結果

リサーチクエスチョン

  • RQ1情報状態とは何か、部分的に観測されるシステムに対してどのように動的計画法を可能にできるか?
  • RQ2履歴を圧縮しつつほぼ最適な計画性能を保持するような近似情報状態(AIS)をどのように定義・定量化できるか?
  • RQ3正確な情報状態の代わりに AIS を用いるときの性能損失の境界は何か?
  • RQ4状態・観測・行動空間における既存の近似を AIS のインスタンスとしてみなすことができるか、そしてそれらはより厳しい保証を生み出すか?
  • RQ5AIS をデータから学習し、PORL(分散強化学習を含む)向けのオンラインポリシー勾配アルゴリズムを設計するにはどうすればよいか、マルチエージェント設定を含む?

主な発見

  • AIS は歴史の原理的な圧縮を提供し、最適性の有界な損失を伴う近似的なダイナミックプログラムを生み出す。
  • 状態・観測・行動空間における多くの既存近似スキームは AIS の特別な場合であり、いくつかのケースではより厳しい境界を提供する。
  • AIS はデータから学習でき、性能低下に関する理論的保証を伴うデータ駆動の PORL を可能にする。
  • 共通情報 AIS を用いた分散システムへの枠組みの拡張により、マルチエージェント PORL 分析を可能にする。
  • 複数の学習タイムスケールを用いた AIS ベースのオンラインポリシー勾配法を導出し、さまざまな環境で検証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。