Skip to main content
QUICK REVIEW

[論文レビュー] Learning Environment-Aware Affordance for 3D Articulated Object Manipulation under Occlusions

Ruihai Wu, Kai Cheng|arXiv (Cornell University)|Sep 14, 2023
Robot Manipulation and Learning被引用数 5
ひとこと要約

本稿では、遮蔽下における3次元アーティキュレートオブジェクトの操作を想定し、ポイントレベルの表現と対照的学習アプローチを活用することで、複雑な遮蔽物の組み合わせに一般化可能な環境に配慮したアフォーダンスフレームワークを提案する。局所的な遮蔽効果のモデル化と、単一遮蔽物シーンにおけるデータ効率の良い対照的訓練を組み合わせることで、新しい複数遮蔽物環境においても、実行可能な操作ポイントの予測が高精度で達成され、シミュレーションおよび実世界スキャンの両方でベースラインを上回る性能を発揮する。

ABSTRACT

Perceiving and manipulating 3D articulated objects in diverse environments is essential for home-assistant robots. Recent studies have shown that point-level affordance provides actionable priors for downstream manipulation tasks. However, existing works primarily focus on single-object scenarios with homogeneous agents, overlooking the realistic constraints imposed by the environment and the agent's morphology, e.g., occlusions and physical limitations. In this paper, we propose an environment-aware affordance framework that incorporates both object-level actionable priors and environment constraints. Unlike object-centric affordance approaches, learning environment-aware affordance faces the challenge of combinatorial explosion due to the complexity of various occlusions, characterized by their quantities, geometries, positions and poses. To address this and enhance data efficiency, we introduce a novel contrastive affordance learning framework capable of training on scenes containing a single occluder and generalizing to scenes with complex occluder combinations. Experiments demonstrate the effectiveness of our proposed approach in learning affordance considering environment constraints. Project page at https://chengkaiacademycity.github.io/EnvAwareAfford/

研究の動機と目的

  • 現実的で遮蔽や物理的制約を伴う環境における3次元アーティキュレートオブジェクトの操作という課題に対処すること。
  • 遮蔽物の数、形状、位置、姿勢の変動に起因するシーンの複雑さの組み合わせ的爆発的増加を克服すること。
  • オブジェクト中心の実行可能priorと環境およびエージェントの制約を統合したポイントレベルのアフォーダンスを学習すること。
  • 単一遮蔽物の学習シーンから、複雑な複数遮蔽物のテストシーンへの一般化を、高いデータ効率で実現すること。
  • 外部遮蔽物と自己遮蔽を両方考慮した衝突を避けるアフォーダンスを予測することで、実世界のシナリオにおける操作成功を向上させること。

提案手法

  • 環境に配慮したアフォーダンスをポイントレベルの表現として導入し、環境的制約やロボットの形状を考慮した実行可能priorを符号化する。
  • 遮蔽物の影響は局所的領域に限定されるという洞察を活用し、シーン理解の有効な複雑さを低減する。
  • 単一遮蔽物シーンでの学習と、複数遮蔽物の組み合わせへの一般化を可能にする、新しい対照的アフォーダンス学習フレームワークを提案する。
  • 衝突を考慮した予測を向上させるために、ロボット、標的オブジェクト、遮蔽物間の空間的関係をモデル化するための遮蔽フィールド(OF)モジュールを統合する。
  • SAPIEN、PartNet-Mobility、ShapeNetデータセットに基づく合成インタラクティブ環境を用いて、ニューラルネットワークを訓練する。
  • 耐障害性を高めるために、アフォーダンススコアと不確実性推定値を出力する二重ヘッド予測ヘッドを採用する。

実験結果

リサーチクエスチョン

  • RQ1単一遮蔽物シーンで学習したモデルは、3次元アーティキュレートオブジェクトの操作において、複雑な複数遮蔽物シーンに一般化可能か?
  • RQ2ポイントレベルのアフォーダンスは、遮蔽物の形状、位置、ロボットの姿勢といった環境的制約に感受可能にできるか?
  • RQ3組み合わせ的シーン複雑性が存在する中で、環境に配慮したアフォーダンスのデータ効率の良い学習に不可欠な要素は何か?
  • RQ4対照的学習は、遮蔽下における実行可能ポイントと非実行可能ポイントの区別能力をどの程度向上させるか?
  • RQ5モデルは、実世界のスキャンシーンにおいて、外部衝突と自己遮蔽の両方を避けるアフォーダンスを予測できるか?

主な発見

  • 提案手法は、複雑な遮蔽付きシーンにおけるプッシュタスクで43.52%、プルタスクで36.19%の操作精度を達成し、すべてのベースラインを上回る。
  • 未知の遮蔽物の組み合わせにおいて、プッシュタスクでは86.11%のFスコアと83.58%の平均適合率、プルタスクでは75.96%のFスコアと75.18%の平均適合率を達成した。
  • アブレーションスタディの結果、遮蔽フィールド(Ours w/o OF)を削除すると、未知のプッシュタスクでFスコア69.02%、AP66.94%に性能が低下し、衝突認識の重要性が示された。
  • 対照的学習(Ours w/o CL)を削除すると、予測の確実性が低下し、未知のプッシュタスクでFスコア74.02%、AP71.62%に低下した。これは、区別能力向上に寄与する役割を示している。
  • モデルは実世界のスキャンシーンに対しても効果的に一般化し、自己衝突や外部遮蔽を避ける妥当なアフォーダンス予測を生成した(図7で妥当性を検証)。
  • 同じシーン内での異なるロボットの位置が、異なるアフォーダンス予測をもたらす(図6)、モデルのエージェントポーズおよび環境コンテキストへの感受性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。