[論文レビュー] Planning with a Receding Horizon for Manipulation in Clutter using a Learned Value Function
本稿では、複雑な環境におけるリアルタイムで閉ループな操作を実現するため、学習された価値関数を備えた後退予測計画法(RHP)を提案する。サンプリングベースの計画法により初期計画を生成し、強化学習を用いて価値関数をファインチューニングすることで、物理的モデルの不一致や接触を伴う相互作用に強く、実世界の不確実性下でも顕著に優れた性能を発揮する高速で反応性の高い計画が可能になる。
Manipulation in clutter requires solving complex sequential decision making problems in an environment rich with physical interactions. The transfer of motion planning solutions from simulation to the real world, in open-loop, suffers from the inherent uncertainty in modelling real world physics. We propose interleaving planning and execution in real-time, in a closed-loop setting, using a Receding Horizon Planner (RHP) for pushing manipulation in clutter. In this context, we address the problem of finding a suitable value function based heuristic for efficient planning, and for estimating the cost-to-go from the horizon to the goal. We estimate such a value function first by using plans generated by an existing sampling-based planner. Then, we further optimize the value function through reinforcement learning. We evaluate our approach and compare it to state-of-the-art planning techniques for manipulation in clutter. We conduct experiments in simulation with artificially injected uncertainty on the physics parameters, as well as in real world tasks of manipulation in clutter. We show that this approach enables the robot to react to the uncertain dynamics of the real world effectively.
研究の動機と目的
- シミュレーションモデルと実世界のダイナミクスの乖離が生じる複雑な物理ベースの環境において、運動計画を実行する課題に対処すること。
- 物理的モデルの不正確さや接触を伴う相互作用に弱いオープンループ計画の限界を克服すること。
- 環境の不確実性にリアルタイムで対応できる高速な閉ループ計画システムを開発すること。
- 手動でヒューリスティックを設計せず、効率的な後退予測計画法を実現するため、データ駆動型の価値関数を学習すること。
- 初期の事前学習後にエンドツーエンドの強化学習によるファインチューニングを用いて、計画性能を向上させること。
提案手法
- シミュレーション内でエキスパートのデモンストレーションを生成するため、キノダイナミクスを考慮したRRTベースのサンプリング計画法を用い、事前学習用の状態-行動-価値ペアを生成する。
- 深層ニューラルネットワーク(DNN)を訓練し、状態-行動ペアの価値を予測することで、その状態からの予想されるコスト・トゥ・ゴールを推定する。
- 短い時間スパンの後退予測計画法(RHP)を実装し、DNNで予測された価値関数をヒューリスティックとして用いて行動選択をガイドする。
- 実行結果との整合性を高めるために、強化学習(PPO)を用いてDNN価値関数をファインチューニングし、耐障害性を向上させる。
- 環境からの更新された観測値を各ステップで再利用することで、リアルタイムのフィードバックを統合し、閉ループでの適応を可能にする。
- 評価時に実世界の不確実性を再現するため、Box2D物理シミュレータに物体パラメータ(形状、摩擦係数、密度)にガウスノイズを注入する。
実験結果
リサーチクエスチョン
- RQ1学習された価値関数は、複雑な操作タスクにおける後退予測計画法の効率性と耐障害性を向上させることができるか?
- RQ2事前学習済み価値関数を強化学習でファインチューニングすることで、物理的モデルの不確実性下での性能にどのような影響を与えるか?
- RQ3学習された価値関数を備えた閉ループRHPは、実世界の実行状況において、オープンループ計画法をどの程度上回るか?
- RQ4データ駆動型の価値関数は、複雑な操作タスクにおいて、手動によるヒューリスティックや報酬形状の設計を不要にすることができるか?
- RQ5計画のホライズンやロールアウト数の選択が、不確実な環境下での成功確率と計算時間のトレードオフにどのように影響するか?
主な発見
- 物理パラメータの不確実性が著しい状況(30%の偏差)下でも、RHPに学習された価値関数を組み合わせたRHP-66は96%の成功率を達成した。これに対して、オープンループのキノダイナミクス計画法は同様の条件下で44%に低下した。
- ホライズン6、ロールアウト66回のRHP(RHP-66)が、あらゆる不確実性レベルで最高の成功率(96%)を記録し、長いホライズンと十分なロールアウト数の有効性を示した。
- 成功した実行ごとの平均計算時間は2秒未満に収まり、強化学習を用いてもほぼリアルタイム動作を実現した。
- UR5ロボットを用いた実世界実験では、RHPが3つのテストタスクすべてで成功したのに対し、オープンループ計画法は3つ中2つで失敗した。
- サンプリングベースの計画法による事前学習と、PPOによるファインチューニングの組み合わせにより、初期のDNN単体よりも実世界のダイナミクスに適応性の高い価値関数が得られた。
- 継続的な再計画により、物体の形状の不一致などの予期しない物理的挙動に対しても、リアルタイムの観測に基づいて強い適応性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。