[論文レビュー] Integrating Task-Motion Planning with Reinforcement Learning for Robust Decision Making in Mobile Robots
本稿では、不確実で動的な環境下で作業するモバイルロボットにおけるロバストで適応的な意思決定を可能にするために、タスク・モーションプランニング(TMP)と強化学習(RL)を統合するフレームワーク、TMP-RLを提案する。反復的TMPによる低コストで実行可能な計画と、現実世界での実行経験に基づいて計画を最適化するモデルフリーRLを組み合わせることで、純粋なTMPやタスクプランニングとRLの統合(TP-RL)と比較して、収束が速く、よりロバストな性能を達成するとともに、異なるタスク間での学習済み知識の転送を可能にする。
Task-motion planning (TMP) addresses the problem of efficiently generating executable and low-cost task plans in a discrete space such that the (initially unknown) action costs are determined by motion plans in a corresponding continuous space. However, a task-motion plan can be sensitive to unexpected domain uncertainty and changes, leading to suboptimal behaviors or execution failures. In this paper, we propose a novel framework, TMP-RL, which is an integration of TMP and reinforcement learning (RL) from the execution experience, to solve the problem of robust task-motion planning in dynamic and uncertain domains. TMP-RL features two nested planning-learning loops. In the inner TMP loop, the robot generates a low-cost, feasible task-motion plan by iteratively planning in the discrete space and updating relevant action costs evaluated by the motion planner in continuous space. In the outer loop, the plan is executed, and the robot learns from the execution experience via model-free RL, to further improve its task-motion plans. RL in the outer loop is more accurate to the current domain but also more expensive, and using less costly task and motion planning leads to a jump-start for learning in the real world. Our approach is evaluated on a mobile service robot conducting navigation tasks in an office area. Results show that TMP-RL approach significantly improves adaptability and robustness (in comparison to TMP methods) and leads to rapid convergence (in comparison to task planning (TP)-RL methods). We also show that TMP-RL can reuse learned values to smoothly adapt to new scenarios during long-term deployments.
研究の動機と目的
- ロボットの実行中に生じるドメインの不確実性や動的変化に対処できない伝統的なタスク・モーションプランニング(TMP)の限界を解消すること。
- 初期計画の品質評価にモーションプランニングを活用することで、現実世界のロボット展開における純粋な強化学習(RL)のサンプル複雑性とリスクを低減すること。
- 異なる出発位置やシナリオにおいても学習済みの価値を再利用することで、モバイルロボットナビゲーションタスクにおける長期的適応性を実現すること。
- TMPとRLのクローズド・ループ統合により、不確実で現実的な環境下でのロボット意思決定のロバスト性と収束速度を向上させること。
提案手法
- フレームワークは、2重のネストされた計画学習ループを採用する:内側のTMPループは、連続空間における行動コストの評価にモーションプランナのフィードバックを用いて、反復的にタスク計画を最適化する。
- 外側のRLループは、計画を実行し、モデルフリー強化学習を用いて現実世界の経験から学習することで、計画の品質を向上させ、ドメインの不確実性に適応する。
- 離散的タスク空間における行動コストは、モーションプランナの評価に基づいて更新され、実行および学習に適した実行可能で低コストの計画のみが提示されるように保証される。
- 時間制約内で計画品質を段階的に向上させるための「いつでも良い計画を返す」アルゴリズム(PETLON)を採用し、より良い計画が得られなければ、利用可能な最高の計画を返す。
- 以前のタスクで学習したQ値を再利用することで、新しい類似シナリオにおける学習を加速させ、異なる出発位置間での知識転送を可能にする。
- 高レベルのタスク計画には記号的計画(例:アセンブリ・セットプログラミング)を、連続的軌道生成にはモーションプランニング(例:RRT)を活用する。
実験結果
リサーチクエスチョン
- RQ1タスク・モーションプランニングと強化学習を統合することで、ドメインの不確実性下でのモバイルロボット意思決定におけるロバスト性と適応性が向上するか?
- RQ2提案されたTMP-RLフレームワークは、純粋なTMPやTP-RLと比較して、学習収束速度と実行安定性においてどのように異なるか?
- RQ31つのタスクで学習した価値は、異なる出発位置を持つ新しい関連タスクにおける学習をどの程度加速できるか?
- RQ4モーションプランニングを用いて計画の品質を事前評価することで、RLトレーニング中の高コストで失敗する実行回数が減少するか?
主な発見
- TMP-RLは、予期しない環境変化に敏感な従来のTMP手法と比較して、顕著にロバスト性と適応性が向上している。
- TMP-RLは、モーションプランニングによる高品質で実行可能な計画を初期段階で得られるため、広範な探索が不要となり、TP-RLと比較して収束が速い。
- TMP-RLとTMPでは、TP-RLと比較して実行報酬の分散が低く抑えられており、計画品質の事前評価による一貫性のある性能が裏付けられている。
- TP-RLは、初期計画品質のフィルタリングが欠如しているため、多くの劣悪な計画を探索し、現実世界展開におけるリスクとコストが高くなる。
- 最初のタスクを学習することで、その後のタスクにおける学習がより速く、分散が小さくなることが示され、異なる出発位置間での学習済みrho値の有効な転送が確認された。
- モーションプランニングが時間制限内でより良い計画を発見できなくても、基礎となるソルバの「いつでも良い計画を返す」性質のおかげで、高い性能を維持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。