Skip to main content
QUICK REVIEW

[論文レビュー] Entropy Regularized Motion Planning via Stein Variational Inference

Alexander Lambert, Byron Boots|arXiv (Cornell University)|Jul 11, 2021
Reinforcement Learning in Robotics参考文献 20被引用数 4
ひとこと要約

本稿では、エントロピー正則化を施したスティン分散推定を用いて、多自由度システムのための多様で低コストかつ衝突のない軌道を生成する、粒子ベースの運動計画法を提案する。軌道最適化を確率的推論として定式化し、ヘッセ行列のガウス=ニュートン近似を活用することで、多モーダルな事後分布からの効率的なサンプリングが可能となり、模倣学習および強化学習におけるロバストな計画と価値関数推定を実現する。

ABSTRACT

Many Imitation and Reinforcement Learning approaches rely on the availability of expert-generated demonstrations for learning policies or value functions from data. Obtaining a reliable distribution of trajectories from motion planners is non-trivial, since it must broadly cover the space of states likely to be encountered during execution while also satisfying task-based constraints. We propose a sampling strategy based on variational inference to generate distributions of feasible, low-cost trajectories for high-dof motion planning tasks. This includes a distributed, particle-based motion planning algorithm which leverages a structured graphical representations for inference over multi-modal posterior distributions. We also make explicit connections to both approximate inference for trajectory optimization and entropy-regularized reinforcement learning.

研究の動機と目的

  • 高自由度の運動計画タスクにおける、多様で低コストな実行可能軌道の分布を生成すること。
  • タスク制約および障害物回避の下で、軌道事後分布の多モーダル性に対処すること。
  • 包括的なエキスパートに類似した軌道の分布を提供することで、サンプル効率の良い模倣学習および強化学習を可能にすること。
  • 変分推論を通じて不確実性とエントロピー正則化を統合することで、従来の軌道最適化手法を改善すること。
  • 構造的グラフィカルモデルと曲率情報を利用した、効率的なサンプリングを可能にするスケーラブルな粒子ベースの推論フレームワークの開発

提案手法

  • 最適性をバイナリ指標変数として表現し、コスト関数を尤度としてモデル化することで、軌道上のベイジアン事後分布推論として運動計画を定式化する。
  • 滑らかさを強制し、スパarsなサポート状態からの効率的な補間を可能にするために、軌道パラメータにガウス過程事前分布を適用する。
  • スティン分散勾配降下法(SVG-D)を、非等方的カーネルとヘッセ行列に基づく計量を用いて実装し、目的事後分布とのKLダイバージェンスを最小化するように粒子位置を反復的に更新する。
  • 計算コストを低減しつつも問題のスパarsityと構造を保持するため、ヘッセ行列のスパースなガウス=ニュートン近似を採用する。
  • 経験的事後分布を用いて粒子ベースの価値関数推定を導出し、モデルベース強化学習および模倣学習への応用を可能にする。
  • 粒子間の平均ヘッセ行列を用いた曲率に配慮した更新により、高次元の軌道空間における収束性と探索性が向上する。

実験結果

リサーチクエスチョン

  • RQ1高次元の運動計画において、低コストで衝突のない軌道の多モーダルな事後分布から、どのように効率的にサンプリングできるか。
  • RQ2エントロピー正則化は、模倣学習における軌道分布の多様性とロバスト性を向上させる役割を果たすか。
  • RQ3ヘッセ行列に基づく計量を用いたスティン分散推定は、収束性と分布品質の観点で、標準的な軌道最適化手法を上回るか。
  • RQ4構造的グラフィカルモデルとスパース線形代数を用いて、どのように確率的運動計画を高自由度システムにスケーラブルに拡張できるか。
  • RQ5粒子ベースの事後分布近似は、モデルベース強化学習における価値関数推定をどの程度改善できるか。

主な発見

  • 提案手法は、7自由度の操作タスクにおいて、可視化および補足動画を通じて、多様で低コストかつ衝突のない軌道を効果的に生成した。
  • 粒子ベースの事後分布近似により、最適価値関数の精度の高い推定が可能となり、式 (25) が微分可能かつスケーラブルな推定を提供することが示された。
  • 平均ヘッセ行列を前処理として用いることで、高次元の軌道空間における収束性が向上し、曲率に配慮した効率的な更新が可能になった。
  • 単一粒子極限においてGPMP2を回復でき、従来の手法と整合性があることが検証された。
  • 質的結果から、1つのホモトピークラス内でも、多様な軌道分布の有効な探索が可能であることが示された。
  • スパース線形ソルバーと構造的ヘッセ行列近似の活用により、特に長時間スパンの計画において顕著な計算高速化が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。