Skip to main content
QUICK REVIEW

[論文レビュー] ClearGrasp: 3D Shape Estimation of Transparent Objects for Manipulation

Shreeyak S. Sajjan, Matthew R. Moore|arXiv (Cornell University)|Oct 6, 2019
Advanced Vision and Imaging参考文献 49被引用数 20
ひとこと要約

ClearGrasp は、RGB-D カメラからの透明物体の不正確な深度推定を補正するための深層学習手法を提案する。表面法線、透明表面マスク、および遮蔽/接触エッジを予測し、グローバル最適化によって深度を精緻化する。吸引力グリッパーと並進グリッパーを用いた実世界の透明物体に対する把持成功率はそれぞれ 86% および 72% を達成し、単眼深度ベースラインを著しく上回る性能を発揮する。

ABSTRACT

Transparent objects are a common part of everyday life, yet they possess unique visual properties that make them incredibly difficult for standard 3D sensors to produce accurate depth estimates for. In many cases, they often appear as noisy or distorted approximations of the surfaces that lie behind them. To address these challenges, we present ClearGrasp -- a deep learning approach for estimating accurate 3D geometry of transparent objects from a single RGB-D image for robotic manipulation. Given a single RGB-D image of transparent objects, ClearGrasp uses deep convolutional networks to infer surface normals, masks of transparent surfaces, and occlusion boundaries. It then uses these outputs to refine the initial depth estimates for all transparent surfaces in the scene. To train and test ClearGrasp, we construct a large-scale synthetic dataset of over 50,000 RGB-D images, as well as a real-world test benchmark with 286 RGB-D images of transparent objects and their ground truth geometries. The experiments demonstrate that ClearGrasp is substantially better than monocular depth estimation baselines and is capable of generalizing to real-world images and novel objects. We also demonstrate that ClearGrasp can be applied out-of-the-box to improve grasping algorithms' performance on transparent objects. Code, data, and benchmarks will be released. Supplementary materials available on the project website: https://sites.google.com/view/cleargrasp

研究の動機と目的

  • RGB-D データにおける透明物体の不正確な深度推定という課題に取り組むこと。これはロボット操作を妨げる要因である。
  • 合成学習データとドメインランダマイゼーションを活用して、実世界の透明物体に一般化可能な手法を開発すること。
  • 深度推定の精度を向上させることで、透明物体におけるロボットの把持性能を改善すること。
  • 大規模な合成データセットと実世界のベンチマークを構築し、透明物体の幾何形状を評価すること。

提案手法

  • ClearGrasp は、1枚の RGB-D イメージから表面法線、透明表面マスク、遮蔽/接触エッジを予測する3つの深層畳み込みネットワークを用いる。
  • 透明表面をマスクして信頼性の低い深度値を除去し、非透明表面からの信頼性の高い深度を遮蔽・接触エッジを用いて拡散させる。
  • 予測された法線、マスク、エッジマップを用いてグローバル最適化を実行し、初期深度マップを精緻化する。
  • 合成データ上で訓練する際にドメインランダマイゼーションを適用し、実世界の変動に強い耐性を向上させる。
  • ドメインギャップを低減するため、モデルはドメイン外の実世界シーン(例:Scannet、Matterport)で事前学習し、ドメイン内合成データで微調整する。
  • エッジ予測には重み付き損失関数を用い、接触エッジを明示的にモデル化することで、深度補完性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1合成データで訓練された深層学習モデルは、実世界の透明物体における正確な 3D 幾何推定に一般化可能か?
  • RQ2表面法線予測、透明マスク推定、エッジ検出の組み合わせが、透明物体の深度補完性能をどの程度向上させるか?
  • RQ3ドメイン内合成データとドメイン外実世界データ(例:Scannet, Matterport)を組み合わせることで、新規の透明物体や実世界シーンへの一般化性能が向上するか?
  • RQ4ClearGrasp は、ベースラインの深度推定手法と比較して、透明物体におけるロボットの把持性能をどの程度向上させるか?
  • RQ5マスク、法線、接触エッジの各コンポーネントが、最終的な深度推定精度に果たす寄与度はどの程度か?

主な発見

  • ClearGrasp は実世界ベンチマークにおいて平均深度誤差 0.027 m(中央値 0.048 m)を達成し、単眼深度推定ベースラインを著しく上回る。
  • 実世界のロボットプラットフォーム上での吸引力グリッパーの把持成功率は 64% から 86% に、並進グリッパーは 12% から 72% に向上した。
  • 真陽性率 >95% のマスク予測が、ノイズの多い深度値を除去し、誤差を大幅に低減させるために不可欠である。
  • 接触エッジの導入と重み付き損失関数の使用により、深度補完性能が向上し、フルモデルでは接触エッジベンチマークで 97.17% の精度を達成した。
  • ドメイン外実世界データ(Scannet/Matterport)で事前学習し、その後合成データで微調整することで、実世界テストセットへの一般化性能が最良となる。
  • アブレーションスタディにより、マスク、法線、接触エッジのすべてのコンポーネントが最適な性能を発揮するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。