Skip to main content
QUICK REVIEW

[論文レビュー] StereoPose: Category-Level 6D Transparent Object Pose Estimation from Stereo Images via Back-View NOCS

Kai Chen, Stephen James|arXiv (Cornell University)|Nov 3, 2022
Robotics and Sensor-Based Localization被引用数 4
ひとこと要約

StereoPoseは、画像アーティファクトのアーリアシングや自己遮蔽による曖昧さを低減するために、新しいバックビューNOCSマップを活用するステレオ画像ベースのフレームワークを提案する。視差に配慮したステレオ特徴統合、エピポーラ幾何学損失、および3段階のパイプライン(サイズ推定、初期ポーズ、最適化)を組み合わせることで、深度マップに依存せずにTODデータセットで最先端の性能を達成した。

ABSTRACT

Most existing methods for category-level pose estimation rely on object point clouds. However, when considering transparent objects, depth cameras are usually not able to capture meaningful data, resulting in point clouds with severe artifacts. Without a high-quality point cloud, existing methods are not applicable to challenging transparent objects. To tackle this problem, we present StereoPose, a novel stereo image framework for category-level object pose estimation, ideally suited for transparent objects. For a robust estimation from pure stereo images, we develop a pipeline that decouples category-level pose estimation into object size estimation, initial pose estimation, and pose refinement. StereoPose then estimates object pose based on representation in the normalized object coordinate space~(NOCS). To address the issue of image content aliasing, we further define a back-view NOCS map for the transparent object. The back-view NOCS aims to reduce the network learning ambiguity caused by content aliasing, and leverage informative cues on the back of the transparent object for more accurate pose estimation. To further improve the performance of the stereo framework, StereoPose is equipped with a parallax attention module for stereo feature fusion and an epipolar loss for improving the stereo-view consistency of network predictions. Extensive experiments on the public TOD dataset demonstrate the superiority of the proposed StereoPose framework for category-level 6D transparent object pose estimation.

研究の動機と目的

  • スペキュラーで反射性の高い素材による深度マップの品質が著しく低い透明物体のカテゴリーレベル6次元ポーズ推定の課題に対処すること。
  • 深度データに著しいアーティファクトを生じるため、透明物体では失敗する既存の点群ベース手法の限界を克服すること。
  • 前面画像に後方の物体構造が表示される画像コンテンツのアーリアシングによって引き起こされる学習の曖昧さを低減すること。
  • 通常は前面のみの表現で無視されがちな、透明物体の背面(例えばハンドル、リム)に含まれる情報的ヒントを活用すること。
  • 深度マップや高品質な点群に依存せずに、堅牢で正確なポーズ推定を実現するステレオ画像ベースのフレームワークを開発すること。

提案手法

  • フレームワークはカテゴリーレベルのポーズ推定を3段階に分離する:物体サイズ推定、初期ポーズ推定、ポーズ最適化。
  • 後方の透明物体の対応関係を密度的にモデル化するバックビューNOCSマップを導入し、アーリアシングによる画像コンテンツの曖昧さを低減する。
  • 視差をガイド信号として用いる視差に配慮したアテンションモジュールにより、ステレオ特徴を統合し、クロスビュー特徴の一貫性を向上させる。
  • エピポーラ幾何学損失により、左・右ビューのNOCS予測がエピポーラ制約を介して対応する点を一致させることで、両ビュー間の一貫性を強制する。
  • ネットワークはステレオRGB画像から前面および背面のNOCSマップを同時に予測し、全体の対応関係の正確性を向上させる。
  • 明示的な深度マップの使用を避ける代わりに、ステレオ幾何学とNOCS表現を活用して、堅牢な6次元ポーズ推定を実現する。

実験結果

リサーチクエスチョン

  • RQ1深度マップに依存せずに、ステレオ画像ベースのフレームワークが透明物体のカテゴリーレベル6次元ポーズ推定を正確に実現できるか?
  • RQ2バックビューNOCSマップを導入することで、透明物体の画像コンテンツアーリアシングに起因する学習の曖昧さはどの程度低減されるか?
  • RQ3視差に配慮したステレオ特徴統合は、標準的なステレオ統合と比較して、ポーズ推定の正確性をどの程度向上させるか?
  • RQ4エピポーラ幾何学損失は、NOCS予測のステレオビュー一貫性をどの程度向上させるか?
  • RQ5背面構造的ヒント(例:ハンドル、リム)は、透明物体のポーズ推定における正確性にどの程度寄与するか?

主な発見

  • 提案されたStereoPoseフレームワークはTODデータセットで3D IoU@25が97.9%を達成し、ベースライン手法を著しく上回った。
  • バックビューNOCSマップを削除すると3D IoU@25が9.6%低下し、背面構造のヒントを処理するうえでその重要性が示された。
  • 視差に配慮したアテンションモジュールを導入することで、ステレオ統合なしのベースラインと比較して3D IoU@25が4.2%向上した。
  • エピポーラ幾何学損失を削除すると3D IoU@25が3.5%上昇し、ステレオ一貫性を強制する有効性が裏付けられた。
  • 完全なモデルは3D IoU@50が77.4%、10°10cm精度が38.2%を達成し、すべてのアブレーションバリアントを上回った。
  • 定性的な結果から、バックビューNOCSマップによりハンドルなどの背面特徴の正確な局所化が可能となり、困難な構成下での回転誤差が低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。