Skip to main content
QUICK REVIEW

[論文レビュー] Max-Plus Matching Pursuit for Deterministic Markov Decision Processes

Francis Bach|arXiv (Cornell University)|Jun 20, 2019
Reinforcement Learning in Robotics参考文献 27被引用数 5
ひとこと要約

本稿では、決定的マルコフ決定過程(MDP)における最適価値関数の近似に、価値関数の辞書におけるスパース表現を用いて、max-plusマッチングプルーリングアルゴリズムを導入する。max-plus代数を活用することで、状態空間のサイズに依存するのではなくカバー数に依存する関係にすることで計算複雑性を低減し、特に低次元の制御問題において、適応的基底選択によりより優れた収束性を実現する。

ABSTRACT

We consider deterministic Markov decision processes (MDPs) and apply max-plus algebra tools to approximate the value iteration algorithm by a smaller-dimensional iteration based on a representation on dictionaries of value functions. The setup naturally leads to novel theoretical results which are simply formulated due to the max-plus algebra structure. For example, when considering a fixed (non adaptive) finite basis, the computational complexity of approximating the optimal value function is not directly related to the number of states, but to notions of covering numbers of the state space. In order to break the curse of dimensionality in factored state-spaces, we consider adaptive basis that can adapt to particular problems leading to an algorithm similar to matching pursuit from signal processing. They currently come with no theoretical guarantees but work empirically well on simple deterministic MDPs derived from low-dimensional continuous control problems. We focus primarily on deterministic MDPs but note that the framework can be applied to all MDPs by considering measure-based formulations.

研究の動機と目的

  • max-plus代数の構造を活用することで、決定的MDPにおける価値関数近似の次元の呪いを克服すること。
  • 信号処理におけるマッチングプルーリングにインspiredされた貪欲なアルゴリズムを考案し、価値関数表現における情報的基底関数の選択を可能とすること。
  • 状態数に依存しない、カバー数に依存する近似複雑性に関する理論的洞察を提供すること。
  • 低次元連続制御問題における適応的基底選択の性能を実験的に評価すること。
  • 測度に基づく定式化により非決定的MDPへフレームワークを拡張することだが、計算複雑性が増加する。

提案手法

  • ベルマン作用素が $(\mathbb{R} \cup \{-\infty\}, \max, +)$ のmax-plus代数において再定式化され、加法的かつ正homogeneousな性質を有する。
  • 有限の基底関数(アトム)の辞書を用いて価値関数近似を実行し、信号処理のマッチングプルーリングに類似した貪欲な選択ルールにより更新を行う。
  • アルゴリズムはmax-plus意味での残差誤差を最も小さくするアトムを選択し、アトム選択には$\ell_1$-ノルム基準を用いる。
  • 固定基底の場合、近似誤差の理論的境界が状態空間のカバー数に基づき導出され、状態数とは独立する。
  • 次元の呪いを緩和するために、固定基底ではなく適応的基底選択を因子付き状態空間に適用し、理論的保証は現在ないが、強い実験的性能を示す。
  • 状態を確率測度としてモデル化することで、非決定的MDPへのフレームワークの拡張が可能となり、測度に基づくベルマン作用素が導入される。

実験結果

リサーチクエスチョン

  • RQ1max-plus代数は、決定的MDPにおける価値関数近似に、より自然で構造的なフレームワークを提供できるか?
  • RQ2max-plus代数において固定有限基底を用いた場合、価値関数近似の計算複雑性はどのようにスケーリングされるか?
  • RQ3適応的基底選択を伴う貪欲なマッチングプルーリング風アルゴリズムは、高次元または因子付きMDPにおいて固定基底法を上回る性能を示せるか?
  • RQ4収束性および近似精度に与えるホライズン $\tau = (1 - \gamma)^{-1}$ の役割は何か?
  • RQ5計算の実行可能性を保ちつつ、max-plusフレームワークを非決定的MDPへどのように拡張できるか?

主な発見

  • 固定非適応的基底の場合、近似誤差は状態数ではなく状態空間のカバー数に依存し、計算複雑性が潜在的に低減される。
  • 辞書内の区分的アフィン関数は、同じ数の基底関数を用いた場合に区分的定数関数よりも著しく優れた近似性能を示す。
  • 大きなホライズン $\rho$(つまり、$T^\rho$ が $T$ に代わる)は、貪欲なマッチングプルーリングの性能を向上させ、より良いアトム選択を可能にする。
  • 2次元制御問題では、選択されたアトムのスパarsityのおかげで、マッチングプルーリングが最適価値関数への収束が速い。
  • 連続制御問題から導出された低次元決定的MDPにおいて、本手法は実験的に成功を収め、基底関数の数が増えるにつれて誤差が減少する。
  • 理論的保証は現在、固定基底に限定されているが、適応的マッチングプルーリングの実験的性能から、高次元問題への強力な可能性が示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。