Skip to main content
QUICK REVIEW

[論文レビュー] Lower Bound On the Computational Complexity of Discounted Markov Decision Problems

Yi‐Chen Chen, Mengdi Wang|arXiv (Cornell University)|May 20, 2017
Reinforcement Learning in Robotics参考文献 17被引用数 11
ひとこと要約

この論文は、有限状態および行動空間を有する無限ホライズン割引マルコフ決定過程(MDP)を解くための、最初の計算量的下界を確立する。標準的な入力表現下では、任意の確率的アルゴリズムが ϵ-最適方策を計算するには Ω(|S|²|A|) 時間を要することを証明している。一方、累積配列や2分木などの効率的なデータ構造に格納された入力では、Ω(|S||A|/ϵ) 時間を要する。これは、入力の構造が計算量に著しく影響することを示している。

ABSTRACT

We study the computational complexity of the infinite-horizon discounted-reward Markov Decision Problem (MDP) with a finite state space $|\mathcal{S}|$ and a finite action space $|\mathcal{A}|$. We show that any randomized algorithm needs a running time at least $Ω(|\mathcal{S}|^2|\mathcal{A}|)$ to compute an $ε$-optimal policy with high probability. We consider two variants of the MDP where the input is given in specific data structures, including arrays of cumulative probabilities and binary trees of transition probabilities. For these cases, we show that the complexity lower bound reduces to $Ω\left( \frac{|\mathcal{S}| |\mathcal{A}|}ε ight)$. These results reveal a surprising observation that the computational complexity of the MDP depends on the data structure of input.

研究の動機と目的

  • 有限状態および行動空間を有する無限ホライズン割引MDPを解くための、最初の計算量的下界を確立すること。
  • 入力データ構造(例:累積確率の配列、2分木)の選択が、MDPのアルゴリズムの実行時間に与える影響を分析すること。
  • 入力表現が有利な場合に、MDPに対してサブライン時間のアルゴリズムが存在可能かどうかを調査すること。
  • 入力データ構造と計算量の関係を、順序付き意思決定問題において明確にすること。
  • より効率的な強化学習および動的計画法の設計に向けた基盤的知見を提供すること。

提案手法

  • MDPソルバーのクエリ複雑度に対する下界を導出するため、行列微分問題(MDP)への還元を用いる。
  • 方策が1つの遷移のみで異なるハードなMDPのインスタンスを構築し、アルゴリズムがそれらをクエリによって区別しなければならないようにする。
  • ミニマックス原理と確率的解析を適用し、高確率で ϵ-最適方策を特定するのに必要なクエリ数の上限を求める。
  • 決定的MDPソルバーを模倣するシミュレーションアルゴリズム(µ′)を設計し、その動作を行列微分クエリにマッピングする。
  • 標準的配列と構造的データ(累積和、2分木)の2つの入力形式の下でクエリ複雑度を分析し、後者では複雑度が低下することを示す。
  • 組合せ的議論と区別可能なMDPインスタンスのペアの数え上げを用いて、実行時間の漸近的下界を導出する。

実験結果

リサーチクエスチョン

  • RQ1高確率で ϵ-最適方策を計算するために必要な最小クエリ数は何か?
  • RQ2入力データ構造(例:配列 vs. 2分木)は、MDPの解法における計算量にどのように影響するか?
  • RQ3累積確率配列などの効率的なデータ構造に格納された入力の場合に、MDPに対してサブライン時間のアルゴリズムが存在可能か?
  • RQ4MDPにおいて、入力表現とアルゴリズム効率の間に根本的なトレードオフがあるか?
  • RQ5遷移を効率的にサンプリングできる能力が、MDPの解法における計算量の低減と相関しているか?

主な発見

  • 標準的な入力表現下では、任意の確率的アルゴリズムが確率 9/10 以上で ϵ-最適方策を計算するには Ω(|S|²|A|) の実行時間が必要である。
  • 入力が累積確率配列や2分木に格納されている場合、下界は Ω(|S||A|/ϵ) に低下し、顕著な複雑度の低減が示された。
  • 下界は入力データ構造に強く依存しており、アルゴリズムの効率が問題のサイズだけではなく、構造にも依存することを示唆している。
  • 結果から、MDPの複雑度が入力表現に強く依存すること、特に構造的入力ではサブライン実行時間が可能になることが明らかになった。
  • 構造的入力下では、既知の上界と比較して対数要因を除き下界がタイトであることが示された。
  • これらの発見は、方策推定におけるサンプル複雑度とMDP解法における計算複雑度の間に深い関連性があることを示唆しているが、その正確な性質は未解決のままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。