Skip to main content
QUICK REVIEW

[論文レビュー] AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains

Haoshu Fang, Chenxi Wang|arXiv (Cornell University)|Dec 16, 2022
Robot Manipulation and Learning被引用数 4
ひとこと要約

AnyGrasp は、平行ジョイントを用いた統合的でリアルタイムなグリップ認識システムを提案する。実世界のデータと重心認識を活用した高密度な空間時間的監視により、7自由度で時間的に滑らかで頑健なグリップポーズを生成する。300個以上の未観測オブジェクトに対するバインピッキングで93.3%の成功を達成し、遊泳するロボットフィッシュの動的キャッチを可能にし、シミュレーションから実世界への転送手法を上回る性能を発揮する。

ABSTRACT

As the basis for prehensile manipulation, it is vital to enable robots to grasp as robustly as humans. Our innate grasping system is prompt, accurate, flexible, and continuous across spatial and temporal domains. Few existing methods cover all these properties for robot grasping. In this paper, we propose AnyGrasp for grasp perception to enable robots these abilities using a parallel gripper. Specifically, we develop a dense supervision strategy with real perception and analytic labels in the spatial-temporal domain. Additional awareness of objects' center-of-mass is incorporated into the learning process to help improve grasping stability. Utilization of grasp correspondence across observations enables dynamic grasp tracking. Our model can efficiently generate accurate, 7-DoF, dense, and temporally-smooth grasp poses and works robustly against large depth-sensing noise. Using AnyGrasp, we achieve a 93.3% success rate when clearing bins with over 300 unseen objects, which is on par with human subjects under controlled conditions. Over 900 mean-picks-per-hour is reported on a single-arm system. For dynamic grasping, we demonstrate catching swimming robot fish in the water. Our project page is at https://graspnet.net/anygrasp.html

研究の動機と目的

  • 構造的でない現実世界環境における人間とロボットのグリップ認識の性能格差を埋める。
  • 1回の順伝播処理で空間的・時間的になめらかに、7自由度の高密度なグリップ予測を実現する。
  • 実世界のデータによる学習と障害物/重心認識を組み合わせることで、深度センサのノイズやオブジェクトの不安定性に対する耐性を向上させる。
  • 静的シーンの仮定を越えて、未観測オブジェクトや動的グリップに一般化できることを示す。
  • 低コストのセンシング下でも、特に実世界データの優位性を実証する。

提案手法

  • ジオメトリ処理モジュールが、モノクローラル深度観測から1回の順伝播で高密度な7自由度グリップ配置を予測する。
  • 時間的関連モジュールが、学習された埋め込み類似度を用いて連続観測間のグリップ対応を追跡する。
  • 空間時間的ドメインにおける実際のセンシングデータと解析的ラベルを用いた高密度な監視により、データ効率を向上させる。
  • トレーニング中に衝突しやすいグリップ候補をフィルタリングすることで、隠れた障害物認識をモデルに組み込む。
  • グリップの安定性を向上させるために、重心(COG)認識を監視信号に統合する。
  • シミュレーションから実世界へのドメインシフトを避けるために、144個の物理的オブジェクトを用いた実世界データ収集をトレーニングに使用する。

実験結果

リサーチクエスチョン

  • RQ1平行ジョイントを搭載したグリップ認識システムは、構造的でない現実世界環境で人間並みの頑健性と効率性を達成できるか?
  • RQ2深度ノイズやオブジェクトの多様性の下で、実世界データによる学習がシミュレーションから実世界への転送に比べて顕著に優れているか?
  • RQ3高密度な空間時間的監視は、時間的に連続的で滑らかなグリップ追跡を実現するためにどの程度有効か?
  • RQ4重心および障害物認識を組み込むことで、グリップの安定性と成功率はどの程度向上するか?
  • RQ5本システムは300個以上の未観測オブジェクトや、動くフィッシュをキャッチするような動的シナリオに一般化できるか?

主な発見

  • AnyGrasp は、300個以上の未観測オブジェクトを含むバインピッキングで93.3%の成功率を達成し、同等の条件下で人間の性能と一致する。
  • 単一アームロボット上で1時間あたり900回を超える平均ピッキングを達成し、高い効率性を示す。
  • 水中で素早く動く小さなロボットフィッシュを成功裏にキャッチし、低摩擦条件下での頑健な動的グリップを実証した。
  • 深刻な深度センシングノイズ下でも高い性能を維持し、センサの不完全性に対する耐性を証明した。
  • 144個の実世界オブジェクトを用いた学習が、数千個のシミュレーテッドオブジェクトを用いた学習を上回り、実データの価値を強調した。
  • アブレーションスタディにより、実世界データ、グリップアノテーションの密度、シーンの多様性が一般化性能に顕著な影響を与えることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。