Skip to main content
QUICK REVIEW

[論文レビュー] KeyPose: Multi-View 3D Labeling and Keypoint Estimation for Transparent Objects

Xingyu Liu, Rico Jonschkowski|arXiv (Cornell University)|Dec 5, 2019
Robot Manipulation and Learning参考文献 36被引用数 7
ひとこと要約

KeyPoseは、深度センサに依存せずに透明な物体の3次元キーポイント推定およびポーズ推定を実現するステレオベースの深層学習手法を提案する。新たなデータ収集およびラベル付けパイプラインを導入することで、48,000枚のステレオおよびRGBD画像を含む透明物体データセット(TOD)を構築し、ステレオ入力の早期融合とマルチビュー再投影損失により、SOTA手法を1.5~3.5倍の性能で上回ることを実証した。これは、真値深度を用いるモデルでさえも上回る結果である。

ABSTRACT

Estimating the 3D pose of desktop objects is crucial for applications such as robotic manipulation. Many existing approaches to this problem require a depth map of the object for both training and prediction, which restricts them to opaque, lambertian objects that produce good returns in an RGBD sensor. In this paper we forgo using a depth sensor in favor of raw stereo input. We address two problems: first, we establish an easy method for capturing and labeling 3D keypoints on desktop objects with an RGB camera; and second, we develop a deep neural network, called $KeyPose$, that learns to accurately predict object poses using 3D keypoints, from stereo input, and works even for transparent objects. To evaluate the performance of our method, we create a dataset of 15 clear objects in five classes, with 48K 3D-keypoint labeled images. We train both instance and category models, and show generalization to new textures, poses, and objects. KeyPose surpasses state-of-the-art performance in 3D pose estimation on this dataset by factors of 1.5 to 3.5, even in cases where the competing method is provided with ground-truth depth. Stereo input is essential for this performance as it improves results compared to using monocular input by a factor of 2. We will release a public version of the data capture and labeling pipeline, the transparent object database, and the KeyPose models and evaluation code. Project website: https://sites.google.com/corp/view/keypose.

研究の動機と目的

  • ステレオRGB入力を用いた透明物体の3次元ポーズ推定に向けた大規模で現実世界のデータセットの不足に対処すること。
  • ロボットスキャンパイプラインを用いて、深度情報に依存せずに透明および不透明な物体の3次元キーポイントをラベル付ける実用的で深度フリーな手法を開発すること。
  • ステレオRGB入力からのみ3次元オブジェクトポーズを予測する深層学習モデルKeyPoseを構築し、透明物体においてSOTAの性能を達成すること。
  • 真値深度やCADモデルを必要とせずに、未学習のテクスチャ、ポーズ、オブジェクトインスタンスへの一般化を可能にすること。
  • ステレオ入力がモノクロナル入力よりも顕著に性能向上をもたらすかどうかを実証すること。これは、競合手法が真値深度を用いる場合でも同様である。

提案手法

  • ロボットアームを用いて、透明およびそれに対応する不透明な物体のマルチビューのステレオRGBおよびRGBDシーケンスを撮影し、カメラポーズの正確な整合性を実現する。
  • AprilTagsとPerspective-n-Point(PnP)を用いて、フレーム間のグローバルカメラポーズを推定し、オブジェクト幾何構造の正確な3次元再構築を可能にする。
  • カメラポーズの最遠点サンプリング(FPS)を用いてキーフレームを選別し、これらのフレームで2次元キーポイント位置を手動でラベル付けする。
  • 既知のカメラポーズとオブジェクト幾何を用いて2次元キーポイントラベルを3次元空間にバックプロジェクションし、3次元キーポイント位置をすべてのフレームに伝搬する。
  • ステレオ画像ペアの早期融合を用いて、RGB入力からのみ3次元キーポイント座標を直接予測する深層ニューラルネットワークKeyPoseを学習する。
  • 3次元キーポイント回帰損失、UV再投影損失、視差損失、および対称キーポイントを扱うための置換不変損失を組み合わせてKeyPoseを最適化する。

実験結果

リサーチクエスチョン

  • RQ1ステレオRGBとロボット姿勢推定にのみ依存する実用的で深度フリーなラベル付けパイプラインを、透明物体の3次元キーポイントに適用可能か?
  • RQ2真値深度を用いるSOTA手法と比較して、ステレオRGB入力からのみ学習した深層学習モデルが、透明物体の3次元ポーズ推定で優れた性能を示せるか?
  • RQ3早期融合と後期融合のどちらが、3次元キーポイントの精度および視差誤差への耐性において優れているか?
  • RQ4微調整なしで、新しいテクスチャ、ポーズ、未学習の透明物体に対してどの程度一般化できるか?
  • RQ5マルチビュー再投影損失および置換不変の監視が、対称キーポイント構成における性能に与える影響は?

主な発見

  • KeyPoseはインスタンスレベルのポーズ推定で12.8 mm、カテゴリーレベルの推定で26.4 mmの3次元平均絶対誤差(MAE)を達成し、SOTA手法を1.5~3.5倍の性能で上回った。
  • 同じデータセットで評価した場合、真値深度を用いるSOTA手法DenseFusionですらも上回り、ステレオRGBが困難な透明物体の状況下で真値深度を凌駆する可能性を示した。
  • ステレオ入力はモノクロナル入力と比較して性能を2倍に向上させ、両眼視差による深度推定の重要性を強調した。
  • アブレーションスタディの結果、早期融合は後期融合よりも顕著に優れた結果を示し、早期融合では1.46 pxの視差MAE、後期融合では1.05 pxであった。
  • 投影損失(視差損失)により、カテゴリーレベルのケースで視差誤差が0.41 px削減され、ステレオ幾何から0.8 mの距離で5.5 mmの深度誤差に相当した。
  • 置換不変損失は対称キーポイントの混同を効果的に防止し、対称キーポイントのクラスタリングを軽減し、木のモデルのような対称的物体の精度向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。