Skip to main content
QUICK REVIEW

[論文レビュー] Action-Constrained Markov Decision Processes With Kullback-Leibler Cost

Ana Bušić, Sean Meyn|arXiv (Cornell University)|Jul 26, 2018
Climate Change Policy and Economics参考文献 1被引用数 8
ひとこと要約

本稿は、外部的摂動によって制御行動が遷移確率を完全に決定できない行動制約付き設定に、TodorovのKullback-Leibler(KL)コストフレームワークを拡張する。制御行動が完全に遷移ダイナミクスを決定できない状況において、スカラ重みパラメータ ζ を用いたパラメータ化されたMDP族を導入し、ODEに基づく手法を用いて最適方策を効率的に計算する。これにより、元のKLフレームワークの固有ベクトル構造を保ちつつ、制約付きMDPの効率的解法が可能となる。

ABSTRACT

This paper concerns computation of optimal policies in which the one-step reward function contains a cost term that models Kullback-Leibler divergence with respect to nominal dynamics. This technique was introduced by Todorov in 2007, where it was shown under general conditions that the solution to the average-reward optimality equations reduce to a simple eigenvector problem. Since then many authors have sought to apply this technique to control problems and models of bounded rationality in economics. A crucial assumption is that the input process is essentially unconstrained. For example, if the nominal dynamics include randomness from nature (e.g., the impact of wind on a moving vehicle), then the optimal control solution does not respect the exogenous nature of this disturbance. This paper introduces a technique to solve a more general class of action-constrained MDPs. The main idea is to solve an entire parameterized family of MDPs, in which the parameter is a scalar weighting the one-step reward function. The approach is new and practical even in the original unconstrained formulation.

研究の動機と目的

  • 既存のKLコストMDPが制御行動に制約がないと仮定しており、風や天候などの外生的摂動をモデル化できないという制限を克服すること。
  • 制御行動が制限され、遷移確率を完全に決定できない行動制約付きMDPを、計算的に効率的に解く手法を開発すること。
  • 平均報酬MDPにおけるTodorovの固有ベクトルベースの解法を、行動空間が制約された状況に一般化すること。
  • UAVの風速の確率的変動下でのナビゲーションなど、外生的ランダムネスを伴うモデルにおいて、実用的な最適方策の計算を可能にすること。
  • 分散制御、合理的無関心、需要ディスpatchシステムなどの応用分野にスケーラブルなフレームワークを提供すること。

提案手法

  • 1ステップ報酬関数にスカラ重み付きの報酬項と、ノーマルダイナミクスに関するKL発散度コストを含むパラメータ化されたMDP族を定式化する。
  • 報酬とKLコストの重みをスカラパrameter ζ で制御し、一括して複数のMDPを解くことを可能にする。
  • 最適方策および価値関数を、ζ の範囲にわたって計算するために常微分方程式(ODE)手法を用いる。
  • 最適方策を、Perron-Frobenius固有ベクトル問題から導出されたねじれた遷移行列 ${\check{P}}_{\zeta}$ の解として得る。
  • 制御行動が制限され、風が外生的マルコフ連鎖としてモデル化されるUAVナビゲーションモデルにこの手法を適用する。
  • 風と障害物のダイナミクスを伴う3次元グリッド状態空間(1,125状態)を用いて、数値的妥当性を検証し、ζ に応じた収束性と方策の適応性を示す。

実験結果

リサーチクエスチョン

  • RQ1制御行動が遷移確率を完全に決定できない行動制約付きシステムに、KLコストMDPフレームワークを拡張できるか?
  • RQ2風や天候などの外生的摂動を伴うMDPにおいて、最適方策を効率的に計算する方法は何か?
  • RQ3スカラ重みパラメータ ζ の変化が、最適方策および価値関数の構造に与える影響は何か?
  • RQ4ODEベースの手法は、制約下でも元のKL-MDPフレームワークの固有ベクトルベースの解構造を保っているか?
  • RQ5UAVナビゲーションタスクにおいて、確率的風速の環境ノイズに最適方策はどのように適応するか?

主な発見

  • ODEベースの手法は、ζ のさまざまな値において最適方策を効率的に計算でき、報酬と制御コストのトレードオフの探索が可能となった。
  • ζ = 0 の場合、方策はノーマル風のベクトル場に従う。ζ = 1 および ζ = 2 の場合、方策は目標に向かって誘導され、ζ が大きくなるほど方向性のバイアスが強くなる。
  • ねじれた遷移行列 ${\check{P}}_{\zeta}$ の固有値は、ζ が高くなるにつれてゼロに近づき、制御プロセスの収束速度が向上し、分散が低下することが示された。
  • コスト・トゥ・ゴール関数 $J^{*}$ は ζ とともにゆっくりと増加するため、中程度の制御努力で高い性能が達成可能であることが示された。
  • 1,125状態という高次元状態空間においても、計算的に扱いやすく、数値実験で安定した収束が観察された。
  • 最適方策は環境条件に適応する:目標から離れた領域では、有利な風の条件を待つことで、有界合理的性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。