Skip to main content
QUICK REVIEW

[論文レビュー] Multi-skill Mobile Manipulation for Object Rearrangement

Jiayuan Gu, Devendra Singh Chaplot|arXiv (Cornell University)|Sep 6, 2022
Domain Adaptation and Few-Shot Learning被引用数 10
ひとこと要約

本論文は、静的でない操作スキルをモバイル操作スキルに置き換え、長時間にわたるオブジェクト再配置タスクにおけるロバスト性を向上させるために領域ゴールナビゲーション報酬を用いるM3と呼ばれるマルチスキルモバイル操作フレームワークを提案する。操作スキルに移動性を付与し、ナビゲーションを固定された点ではなく柔軟な領域にターゲットとすることで、M3はHome Assistant Benchmarkにおいてクロスコンフィギュレーションタスクで71.2%、クロスレイアウトタスクで55.0%の成功率を達成し、ベースラインを大きく上回った。

ABSTRACT

We study a modular approach to tackle long-horizon mobile manipulation tasks for object rearrangement, which decomposes a full task into a sequence of subtasks. To tackle the entire task, prior work chains multiple stationary manipulation skills with a point-goal navigation skill, which are learned individually on subtasks. Although more effective than monolithic end-to-end RL policies, this framework suffers from compounding errors in skill chaining, e.g., navigating to a bad location where a stationary manipulation skill can not reach its target to manipulate. To this end, we propose that the manipulation skills should include mobility to have flexibility in interacting with the target object from multiple locations and at the same time the navigation skill could have multiple end points which lead to successful manipulation. We operationalize these ideas by implementing mobile manipulation skills rather than stationary ones and training a navigation skill trained with region goal instead of point goal. We evaluate our multi-skill mobile manipulation method M3 on 3 challenging long-horizon mobile manipulation tasks in the Home Assistant Benchmark (HAB), and show superior performance as compared to the baselines.

研究の動機と目的

  • 長時間にわたるモバイル操作タスクにおけるスキルチェーンによる誤差の累積を解消すること。
  • 操作スキルに移動性を付与することで、モジュラーなスキルのロバスト性と組み合わせ可能性を向上させること。
  • 点ゴールナビゲーションから領域ゴールナビゲーションに置き換えることで、ナビゲーションの目的の曇りを軽減すること。
  • より良いスキル定式化を通じて、未知の環境(クロスレイアウト)における一般化能力と成功確率を向上させること。
  • 実現可能で、組み合わせ可能で、再利用可能なスキルという設計原則を確立し、実体化AIにおける効果的なサブタスク分解を実現すること。

提案手法

  • タスク実行中にベースの移動を許可するモバイル操作スキルに、静的でない操作スキルを置き換える。
  • 固定された点ゴールではなく、実現可能なゴール領域を定義する領域ゴールナビゲーション報酬を導入し、ナビゲーションのロバスト性を向上させる。
  • ナビゲーションポリシーを、ターゲット領域内の任意の位置に到達させることで、初期ナビゲーションの正確さに依存するのを減らす。
  • 衝突ペナルティをナビゲーション報酬に組み込み、環境との意図しない相互作用(例:ドアを過剰に閉じる)を回避する。
  • モジュラーなスキルハイアラルキーを用いて、モバイル操作スキルと領域ゴールナビゲーションを連結し、柔軟でエラーに強いタスク実行を可能にする。
  • 実現可能性と組み合わせ可能性のトレードオフに基づき、操作スキルの初期状態を定式化し、非現実的またはあまりに広すぎる分布を避ける。

実験結果

リサーチクエスチョン

  • RQ1モバイル操作スキルは、静的スキルに比べてスキルチェーンにおける誤差の累積を軽減できるか?
  • RQ2点ゴールナビゲーションから領域ゴールナビゲーションに置き換えることで、ポリシーの一般化能力と成功確率はどのように向上するか?
  • RQ3操作スキルの初期状態分布をどれだけ拡張できるが、性能の低下を引き起こさないか?
  • RQ4ナビゲーション報酬に衝突ペナルティを追加することで、環境との相互作用の安全性とタスク成功確率は向上するか?
  • RQ5提案手法は、クロスコンフィギュレーションおよびクロスレイアウト一般化設定において、どのように性能を発揮するか?

主な発見

  • M3は、Home Assistant Benchmarkにおいてクロスコンフィギュレーション設定で71.2%、クロスレイアウト設定で55.0%の成功率を達成し、すべてのベースラインを上回った。
  • モバイル操作アプローチ(M+P)は、クロスコンフィギュレーションで64.9%、クロスレイアウトで36.2%の成功率を達成し、静的ベースライン(S+P)の57.4%および31.1%を大きく上回った。
  • ナビゲーション報酬に衝突ペナルティを追加することで、成功率はS+Pから65.2%に、M+Pから67.9%に向上した(S+P対S+P(C)、M+P対M+P(C))。これは、安全な相互作用に不可欠であることを示している。
  • アブレーションスタディの結果、静的スキルの初期状態分布を単に拡大する(S(L)+P)と、Pick in TidyHouseで95%から45%に性能が低下し、単純な拡大は非現実的であることが示された。
  • 領域ゴールナビゲーション報酬により、クロスレイアウト設定での一般化能力が向上し、M3はM+Pの36.2%に対し55.0%の成功率を達成した。これは、ゴール指定の曇りが軽減されたことを示している。
  • 定性的な結果から、モバイル操作はナビゲーションの不完全さを補正し、ターゲットにアクセスするための再位置決めを可能にするが、静的操作ではナビゲーションが最適でない領域に着地すると失敗することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。