Skip to main content
QUICK REVIEW

[論文レビュー] PODDP: Partially Observable Differential Dynamic Programming for Latent Belief Space Planning

Dicong Qiu, Yibiao Zhao|arXiv (Cornell University)|Dec 14, 2019
Robotic Path Planning Algorithms参考文献 44被引用数 5
ひとこと要約

PODDP は、連続的な状態・行動・観測および非線形ダイナミクスを伴う部分的に観測可能なマルコフ決定過程(POMDP)における信念空間計画のための新しい微分可能トラジェクトリ最適化アルゴリズムであり、不確実性は離散的な隠れ状態に起因する。この手法は信念トラジェクトリの木を用いた動的計画法により、継続的計画を最適化し、不確実な目的、ダイナミクス、エージェントの意図を伴うタスクにおいて、ヒューリスティックなベースラインを著しく上回る性能を示しており、ベンチマークおよび自律走行実験において累積コストが低くなることを確認した。

ABSTRACT

Autonomous agents are limited in their ability to observe the world state. Partially observable Markov decision processes (POMDPs) formally model the problem of planning under world state uncertainty, but POMDPs with continuous actions and nonlinear dynamics suitable for robotics applications are challenging to solve. In this paper, we present an efficient differential dynamic programming (DDP) algorithm for belief space planning in POMDPs with uncertainty over a discrete latent state, and continuous states, actions, observations, and nonlinear dynamics. This representation allows planning of dynamic trajectories which are sensitive to structured uncertainty over discrete latent world states. We develop dynamic programming techniques to optimize a contingency plan over a tree of possible observations and belief space trajectories, and also derive a hierarchical version of the algorithm. Our method is applicable to problems with uncertainty over the cost or reward function (e.g., the configuration of goals or obstacles), uncertainty over the dynamics (e.g., the dynamical mode of a hybrid system), and uncertainty about interactions, where other agents' behavior is conditioned on latent intentions. Benchmarks show that our algorithm outperforms popular heuristic approaches to planning under uncertainty, and results from an autonomous lane changing task demonstrate that our algorithm can synthesize robust interactive trajectories.

研究の動機と目的

  • 非ガウス的で多次元な信念構造を伴う連続的状態・連続的行動のロボティクスタスクにおける部分的観測下の計画課題に取り組む。
  • 連続的行動および非線形ダイナミクスに対応できない既存のガウス的信念空間プランナーや一般化されたPOMDPソルバーの限界を克服する。
  • 離散的隠れ状態(例:目的位置、システムモード、エージェントの意図など)に起因する構造的不確実性を考慮した効率的で微分可能なトラジェクトリ最適化を実現する。
  • 特に再帰的ホライズン計画および他のエージェントとの相互作用を伴う不確実性下でのリアルタイムロボティクスアプリケーションに適したスケーラブルな手法を開発する。

提案手法

  • 連続的状態・行動・観測および非線形ダイナミクスを伴うPOMDPとして計画問題を定式化し、信念の不確実性は離散的隠れ変数に起因するものとする。
  • 観測系列の可能性とそれに対応する信念状態トラジェクトリの木として継続的計画を構築し、不確実性下でのマルチステップ先読み計画を可能にする。
  • 各観測後のベイズ的信念更新を用いて、信念ダイナミクスに沿って近似的な価値関数を後退的に伝播する動的計画法を適用する。
  • 微分動的計画法(DDP)を用いて価値関数およびコスト・トゥ・ゴールの解析的勾配を導出することで、トラジェクトリ木の局所最適化を可能にする。
  • 特に制御周波数が観測周波数に比べて高い状況において計算効率を向上させるために、問題の階層的分解を導入する。
  • 各観測後にベイズの定理を用いて更新される離散的隠れ状態上のカテゴリカル分布を信念状態表現として用いる。

実験結果

リサーチクエスチョン

  • RQ1微分可能なトラジェクトリ最適化フレームワークは、離散的隠れ状態に起因する多次元信念構造を伴う連続的POMDPにおいて効果的に処理できるか?
  • RQ2PODDPは、完全観測を仮定するヒューリスティック手法や、隠れ状態に重み付けされたコスト関数を用いる手法と比較して、計画性能およびロバスト性において優れているか?
  • RQ3他のエージェントの行動が観測不能な意図に依存するインタラクティブタスクにおいて、PODDPは効果的な継続的計画を合成できるか?
  • RQ4多様な不確実性タイプにわたる累積コストおよび成功確率の観点から、PODDPは最先端のヒューリスティックベースラインをどの程度上回るか?

主な発見

  • 粗い地形走行実験では、PODDPはMLDDPおよびPWDDPと比較して顕著に低い平均累積コストを達成した。それぞれp値は0.00008(t(1998) = 3.9)および0.007(t(1998) = 2.7)であった。
  • インタラクティブなレーンチェンジタスクでは、PODDPはMLDDP(p < 0.00001)およびPWDDP(p < 0.00001)と比較して有意に低いコストを記録し、意図の不確実性下でも優れた性能を示した。
  • 初期信念が攻撃的(b0(Nice) = 0.49)を支持する場合、MLDDPは最大尤度バイアスのため過剰に減速し、ネイシー運転手の通過に失敗した。
  • バランスの取れた事前分布(b0(Nice) = 0.51)の下では、MLDDPはネイシー運転手の通過に成功したが、依然としてPODDPより高い平均コストを記録した。これにより、PODDPのロバスト性と効率性が裏付けられた。
  • PODDPは、隠れ状態推論に応じて適応する継続的計画を効果的に生成した—ネイシー運転手の前で合流し、攻撃的運転手の後方で停止するなど、意図を認識した計画が実現された。
  • 可視化および100サンプルの実行結果から、PODDPのトラジェクトリが高成功率と安定した信念更新を示し、複数の観測経路にわたってロバストであることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。