Skip to main content
QUICK REVIEW

[論文レビュー] Robust Combination of Local Controllers

Carlos Guestrin, Dirk Ormoneit|arXiv (Cornell University)|Jan 10, 2013
Robotic Path Planning Algorithms参考文献 11被引用数 8
ひとこと要約

本稿では、遷移確率とゴール到達の信頼性に関する不確実性に対処するために、運動計画と割引MDP(MDP)における局所的に設計されたコントローラーを強固に組み合わせる非パrametric手法を提案する。不確実性下でも高い確率でゴールに到達するための多項式スケールのサンプル数で十分であることを証明し、期待コスト最小化の実用的代替手法を提供する。

ABSTRACT

Planning problems are hard, motion planning, for example, isPSPACE-hard. Such problems are even more difficult in the presence of uncertainty. Although, Markov Decision Processes (MDPs) provide a formal framework for such problems, finding solutions to high dimensional continuous MDPs is usually difficult, especially when the actions and time measurements are continuous. Fortunately, problem-specific knowledge allows us to design controllers that are good locally, though having no global guarantees. We propose a method of nonparametrically combining local controllers to obtain globally good solutions. We apply this formulation to two types of problems : motion planning (stochastic shortest path) and discounted MDPs. For motion planning, we argue that usual MDP optimality criterion (expected cost) may not be practically relevant. Wepropose an alternative: finding the minimum cost path,subject to the constraint that the robot must reach the goal withhigh probability. For this problem, we prove that a polynomial number of samples is sufficient to obtain a high probability path. For discounted MDPs, we propose a formulation that explicitly deals with model uncertainty, i.e., the problem introduced when transition probabilities are not known exactly. We formulate the problem as a robust linear program which directly incorporates this type of uncertainty.

研究の動機と目的

  • 高次元の連続的状態空間・連続的行動空間・連続的時間を持つMDPを、特に不確実性下で解く難しさに対処すること。
  • 実用的な運動計画において、ゴール到達の信頼性が期待コスト最小化よりも重要であることに鑑み、従来のMDP最適性基準(例:期待コスト)の限界を克服すること。
  • グローバルなモデル知識を必要とせずに、局所的に有効なコントローラーを統合してグローバルに強固な方策を構築する手法を開発すること。
  • ロバストな線形計画法の定式化を通じて、割引MDPにおけるモデル不確実性を明示的に取り扱うこと。

提案手法

  • グローバル方策のパラメトリックな形を仮定せずに、非パラメトリックなアプローチにより局所的コントローラーを組み合わせる。
  • 運動計画の文脈では、期待コスト最小化ではなく、ゴール到達確率を高確率に保つことを目的関数に再定式化する。
  • 遷移確率の不確実性を組み込んだロバストな線形計画法の定式化を導入し、モデル誤差に対するロバスト性を実現する。
  • サンプリングに基づくアプローチを用いて、高確率でのゴール到達を達成するための多項式スケールのサンプル数が十分であることを示す。
  • 本フレームワークを、確率的最短経路問題と割引MDPの両方の設定に適用し、さまざまな計画タスクへの適用可能性を示す。
  • 不確実性を直接的にモデル化・管理できるロバスト最適化フレームワークを用い、モデル不適合下でも信頼性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1グローバルなモデル知識やパラメトリックな仮定を必要とせずに、局所的に有効なコントローラーを統合してグローバルに強固な方策を構築できるか?
  • RQ2不確実性下での運動計画において、期待コスト最小化が十分であるか、あるいは実用的であるか。それとも、ゴール到達確率を優先すべきか?
  • RQ3確率的最短経路問題において、多項式スケールのサンプル数が高確率でのゴール到達を保証できるか?
  • RQ4遷移確率のモデル不確実性を、MDPの解法手法に形式的に組み込むにはどうすればよいか?
  • RQ5計算の実行可能性を維持したまま、割引MDPにおける不確実性を効果的に扱えるロバストな線形計画法の定式化は可能か?

主な発見

  • 高確率でのゴール到達を達成するためのパスを構築するのに、多項式スケールのサンプル数で十分であることが示され、確率的最短経路問題における強い有限サンプル保証が得られた。
  • 提案されたロバストな線形計画法の定式化は、遷移確率の不確実性を効果的に扱い、モデル不適合下でも信頼性を向上させた。
  • グローバルなモデル知識やパラメトリックな仮定を必要とせずに、局所的コントローラーを統合してグローバルに有効な方策を構築できた。
  • 期待コスト最小化に比べ、ゴール到達の信頼性を優先することで、実用的な運動計画において本手法が優れた性能を示した。
  • 本フレームワークは、確率的最短経路問題と割引MDPの両方の設定に適用可能であり、計画タスク全体にわたる広範な有用性を示した。
  • 理論的分析により、有限で多項式的に有界なサンプル数で高確率でのゴール到達が達成可能であることが確認され、スケーラビリティと実用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。