Skip to main content
QUICK REVIEW

[論文レビュー] Probabilistic Contraction Analysis of Iterated Random Operators

Abhishek Gupta, Rahul Jain|arXiv (Cornell University)|Apr 4, 2018
Markov Chains and Monte Carlo Methods被引用数 4
ひとこと要約

本稿では、完全な距離空間における反復確率的作用素によって生成されるマルコフ連鎖の確率的収束を確立するための、新しい確率的収縮解析フレームワークを提案する。独立同分布の標本抽出のもとで確率的優位性と収縮性を活用することで、決定的収縮作用素の不動点が極限において確率的不動点となることを証明し、連続状態のMDPにおけるフィッテッド価値反復などのモンテカルロ法の収束保証を可能にする。

ABSTRACT

In many branches of engineering, Banach contraction mapping theorem is employed to establish the convergence of certain deterministic algorithms. Randomized versions of these algorithms have been developed that have proved useful in data-driven problems. In a class of randomized algorithms, in each iteration, the contraction map is approximated with an operator that uses independent and identically distributed samples of certain random variables. This leads to iterated random operators acting on an initial point in a complete metric space, and it generates a Markov chain. In this paper, we develop a new stochastic dominance based proof technique, called probabilistic contraction analysis, for establishing the convergence in probability of Markov chains generated by such iterated random operators in certain limiting regime. The methods developed in this paper provides a general framework for understanding convergence of a wide variety of Monte Carlo methods in which contractive property is present. We apply the convergence result to conclude the convergence of fitted value iteration and fitted relative value iteration in continuous state and continuous action Markov decision problems as representative applications of the general framework developed here.

研究の動機と目的

  • 反復確率的作用素に基づくモンテカルロアルゴリズムの収束を分析する一般枠組みを構築すること。
  • 決定的収縮作用素の不動点が、確率的標本抽出のもとでどのように確率的不動点に変わるかの条件を確立すること。
  • 最適化および強化学習における広範なランダムアルゴリズムに適用可能な、確率的優位性に基づく証明技法を提供すること。
  • 連続状態および連続行動のマルコフ決定過程におけるフィッテッド価値反復およびフィッテッド相対価値反復の収束を示すこと。

提案手法

  • 完全な距離空間における反復確率的作用素の漸近的挙動を分析するため、確率的優位性に基づく新しい証明技法を提案する。
  • 確率的不動点を、標本サイズが増加するにつれて確率的に収束するランダムな反復の極限点として定義する。
  • 収縮写像の性質と独立同分布の標本抽出を組み合わせ、各作用素の近似を決定的写像の確率的摂動としてモデル化する。
  • 割合の価値反復の収束を証明するために、フレームワークを割合割引および平均コストMDP(連続状態および連続行動を伴う)に適用する。
  • 後向き反復の議論と不変分布の分析を用いて、確率的作用素によって生成されるマルコフ連鎖の極限的挙動を特徴付ける。
  • 標本数が増加するにつれて、確率的作用素連鎖の不変分布が真の不動点のまわりに集中する条件を確立する。

実験結果

リサーチクエスチョン

  • RQ1決定的収縮作用素の不動点が、反復確率的作用素のもとで、どのような条件下で確率的不動点のままであるか。
  • RQ2確率的優位性をどのように用いることで、確率的作用素によって生成されるマルコフ連鎖の確率的収束を証明できるか。
  • RQ3この確率的収縮フレームワークを用いて、連続状態MDPにおけるフィッテッド価値反復の収束を保証する十分条件は何か。
  • RQ41回の反復における標本数の増加が、真の不動点のまわりでのランダム反復の集中度にどのように影響するか。

主な発見

  • 提案されたフレームワークのもとで、決定的収縮作用素の不動点が確率的不動点であることが示された。これは、1回の反復における標本数が増加するにつれて、反復がその不動点に確率的に収束することを意味する。
  • フレームワークにより、弱い正則性条件のもとで、割合割引および平均コストの連続状態MDPにおけるフィッテッド価値反復が確率的に収束することが証明された。
  • 特定の出生死滅連鎖モデルに対して、不変分布を明示的に計算した。その結果、π^Q(0) = (2p^β - 1)/p^β が得られ、p^β ≥ 0.5 のとき非負であることが示された。
  • p > 2β/(2β + 1) ならば、p^β > 0.606 であることが示され、不変分布が適切に定義されかつ正であることが保証された。
  • 証明技法は、状態のブロックごとに不変分布の形を導出するための数学的帰納法に依存しており、尾部確率が指数的減少することを示している。
  • 本フレームワークは、収縮的確率的作用素に基づく再帰的確率的アルゴリズムの標本複雑度および一貫性を分析する一般化可能なツールを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。