Skip to main content
QUICK REVIEW

[論文レビュー] Recovering 6D Object Pose and Predicting Next-Best-View in the Crowd

Andreas Doumanoglou, Rigas Kouskouridas|arXiv (Cornell University)|Dec 23, 2015
Advanced Neural Network Applications参考文献 31被引用数 12
ひとこと要約

本稿では、スパース自己符号化器とハフフォレストを用いた教師なし特徴学習により、混雑したシーンにおける6次元オブジェクトポーズ推定と次に最良のビューを予測するための統合フレームワークを提示する。ポーズ分類と回帰を同時に最適化することでポーズ推定精度を向上させ、リーフノードのエントロピーと遮蔽モデリングを活用した不確実性を考慮した次に最良のビュー選択を実現し、公開および独自のデータセットにおいて最先端の性能を達成している。特に、RGB-Dのボックスピッキングデータセットを新たにアノテートした。

ABSTRACT

Object detection and 6D pose estimation in the crowd (scenes with multiple object instances, severe foreground occlusions and background distractors), has become an important problem in many rapidly evolving technological areas such as robotics and augmented reality. Single shot-based 6D pose estimators with manually designed features are still unable to tackle the above challenges, motivating the research towards unsupervised feature learning and next-best-view estimation. In this work, we present a complete framework for both single shot-based 6D object pose estimation and next-best-view prediction based on Hough Forests, the state of the art object pose estimator that performs classification and regression jointly. Rather than using manually designed features we a) propose an unsupervised feature learnt from depth-invariant patches using a Sparse Autoencoder and b) offer an extensive evaluation of various state of the art features. Furthermore, taking advantage of the clustering performed in the leaf nodes of Hough Forests, we learn to estimate the reduction of uncertainty in other views, formulating the problem of selecting the next-best-view. To further improve pose estimation, we propose an improved joint registration and hypotheses verification module as a final refinement step to reject false detections. We provide two additional challenging datasets inspired from realistic scenarios to extensively evaluate the state of the art and our framework. One is related to domestic environments and the other depicts a bin-picking scenario mostly found in industrial settings. We show that our framework significantly outperforms state of the art both on public and on our datasets.

研究の動機と目的

  • 混雑したシーンにおける深刻な遮蔽、ごみの多さ、背景の干渉要因を伴う6次元オブジェクトポーズ推定の課題に対処すること。
  • 単一ショット6次元ポーズ推定における手作業で設計された特徴の限界を克服し、スパース自己符号化器による教師なし特徴学習を導入すること。
  • ハフフォレストが内蔵するクラスタリングおよびエントロピー推定機能を活用し、不確実性に基づいたアクティブな次に最良のビュー選択を可能にすること。
  • 誤検出を低減するための統合最適化と検証ステップを統合することで、検出のロバスト性を向上させること。
  • 公開ベンチマークおよび2つの新しい実世界のRGB-Dデータセット(家庭用および産業用ボックスピッキングシナリオ)上でフレームワークを評価すること。

提案手法

  • スパース自己符号化器を用いて教師なしで画像パッチから深さ不変特徴を学習し、手作業で設計された特徴に代わる。
  • ハフフォレストを用いて6次元ハフ投票を通じてポーズ仮説の集約を実現する6次元ハフ投票による同時分類と6次元回帰を実施。
  • ハフフォレストのリーフノードにおけるポーズ仮説のエントロピーを用いて不確実性を推定し、次に最良のビュー予測を誘導する。
  • 候補となる視点からの可視性および部分的遮蔽のシミュレーションを実施することで、次に最良のビュー推定時に遮蔽モデリングを統合する。
  • 誤検出を排除するための統合最適化と検証モジュールを適用し、ポーズ仮説を精緻化することで最終的な精度を向上させる。
  • 5 \cdot 10^6枚のパッチを用いてハフフォレストを学習し、並列実装により学習時間を短縮する。

実験結果

リサーチクエスチョン

  • RQ1スパース自己符号化器による教師なし特徴学習は、手作業で設計された特徴と比較して、混雑で遮蔽のひどいシーンにおける6次元オブジェクトポーズ推定を改善できるか?
  • RQ2ハフフォレストはポーズ推定に加え、不確実性に基づいたアクティブな次に最良のビュー選択にも効果的に活用できるか?
  • RQ3次に最良のビュー予測時に遮蔽をモデリングすることで、その後のポーズ推定精度にどのような影響を与えるか?
  • RQ4誤検出および曖昧な仮説が存在する状況下で、統合最適化はポーズ推定精度をどの程度向上させるか?
  • RQ5提案されたフレームワークは、標準ベンチマークをはるかに超える実世界のシナリオにどの程度一般化できるか?

主な発見

  • 提案手法はスーパーマーケットシナリオで平均71.2%の正確度を達成し、ボックスピッキングシナリオでは36.1%を達成し、先行SOTA手法を上回った。
  • 統合最適化を適用することで、全テストオブジェクトで最大8.9ポイントの性能向上(例:「エリート」オブジェクトでは77.6% vs. 74.9%)を達成した。
  • 遮蔽の最適化付きの次に最良のビュー予測は一貫して最適なビューを選択するが、最適化なしのベースラインはしばしば前面視点に固定され、遮蔽されたオブジェクトを逃すことがある。
  • 学習時間の大幅な短縮が達成された:i7 CPU上では1本のツリーあたり90分で、先行手法の3~24時間と比較して顕著に短縮された。
  • 本手法は優れた一般化性能を示し、公開データセットおよび新たに導入された困難な実世界データセットの両方で最先端の結果を達成した。
  • 本フレームワークは、1つのパッチベースのハフフォレストフレームワーク内で、教師なし特徴学習、6次元ポーズ推定、不確実性を考慮した次に最良のビュー予測を統合した初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。