Skip to main content
QUICK REVIEW

[論文レビュー] 6D Object Pose Estimation with Depth Images: A Seamless Approach for Robotic Interaction and Augmented Reality

David Joseph Tan, Nassir Navab|arXiv (Cornell University)|Sep 5, 2017
Robotics and Sensor-Based Localization参考文献 10被引用数 13
ひとこと要約

本論文は、深度画像を用いたシームレスな6次元オブジェクトポーズ推定フレームワークを提示する。このフレームワークは、高精度なオブジェクト検出器と、ランダムフォレストに基づく低遅延時間的トラッカーを統合しており、1つのCPUコアで1フレームあたり2msのトラッキング遅延を達成し、ロボット工学および拡張現実(AR)アプリケーションにおける、ごみ混じり、遮蔽状態、照明条件の変化がある環境でもリアルタイム性能を実現する。検出では99.3%のf1スコアを達成し、最先端の性能を実現している。

ABSTRACT

To determine the 3D orientation and 3D location of objects in the surroundings of a camera mounted on a robot or mobile device, we developed two powerful algorithms in object detection and temporal tracking that are combined seamlessly for robotic perception and interaction as well as Augmented Reality (AR). A separate evaluation of, respectively, the object detection and the temporal tracker demonstrates the important stride in research as well as the impact on industrial robotic applications and AR. When evaluated on a standard dataset, the detector produced the highest f1-score with a large margin while the tracker generated the best accuracy at a very low latency of approximately 2 ms per frame with one CPU core: both algorithms outperforming the state of the art. When combined, we achieve a powerful framework that is robust to handle multiple instances of the same object under occlusion and clutter while attaining real-time performance. Aiming at stepping beyond the simple scenarios used by current systems, often constrained by having a single object in absence of clutter, averting to touch the object to prevent close-range partial occlusion, selecting brightly colored objects to easily segment them individually or assuming that the object has simple geometric structure, we demonstrate the capacity to handle challenging cases under clutter, partial occlusion and varying lighting conditions with objects of different shapes and sizes.

研究の動機と目的

  • ごみ混じり、遮蔽状態、照明条件の変化がある複雑な環境でも、耐障害性がありリアルタイムな6次元オブジェクトポーズ推定を実現すること。
  • 従来のシステムが単一オブジェクト、遮蔽なし、または幾何学的に単純な状況に依存しているという限界を是正すること。
  • 連続的なロボットの認識とインタラクションを可能にする、オブジェクト検出と時間的トラッキングを組み合わせた二段階フレームワークの開発。
  • 低コストの計算負荷と、一般の深度センサーや標準CPUとの互換性を確保すること。
  • 産業用ロボット工学、拡張現実、モバイルプラットフォームへの実用的導入を支援し、リアルタイム性能と低メモリフットプリントを両立させること。

提案手法

  • オブジェクト検出器は、深度画像上をスライディングウィンドウで走査し、合成された深度画像でトレーニングされたランダムフォレストを用いて、6次元ポーズ(3次元の並進と3次元の回転)を予測する。
  • 時間的トラッカーは、連続するフレーム間の相対的な6次元変換をランダムフォレストで推定し、検出器の出力を初期化として利用する。
  • 両モデルは、オブジェクトの3次元CADモデルの周囲を仮想カメラで位置決めすることで生成された合成深度データ上で、エンドツーエンドにトレーニングされる。
  • トラッカーは、ジャイターや精度の向上を図るため、RGBと深度画像の両方を最適化に活用する。
  • フレームワークはCPUオンリーハードウェアでも効率的に動作するように設計されており、1コアで約2ms/フレームの速度でトラッカーが動作する。
  • 1オブジェクトあたりのメモリ使用量は約40.5 MBにまで最小限に抑えられ、リソース制限のあるプラットフォームへのデプロイが可能である。

実験結果

リサーチクエスチョン

  • RQ1部分的遮蔽、ごみ混じり、照明条件の変化といった困難な現実世界の条件下でも、検出とトラッキングを統合したパイプラインが最先端の精度とリアルタイム性能を達成できるか?
  • RQ2本手法は、部分的遮蔽、ごみ混じり、照明条件の変化がある状況において、既存の手法と比較してどの程度優れているか?
  • RQ3GPUアクセラレーションに依存せず、CPUベースのシステムが2ms未満の低遅延トラッキングを実現できるか?
  • RQ4本フレームワークは、複雑な形状や小さなオブジェクトを含む多様なオブジェクト形状・サイズに一般化できるか?
  • RQ5トラッカーにおけるRGBと深度データの統合は、ARアプリケーションにおけるポーズ推定の安定性向上とジャイタ低減にどの程度寄与するか?

主な発見

  • 提案された検出器は、LineModデータセットで99.3%のf1スコアを達成し、従来の最先端手法(例:ディープラーニング手法で97.2%)を大きく上回り、遮蔽やごみ混じりに対しても耐障害性を示した。
  • 時間的トラッカーは、並進方向でミリメートル未満の精度、回転方向で1度未満の精度を達成し、C&CおよびARベンチマークで、比較されたすべての手法の中で最小の誤差を記録した。
  • 1つのCPUコアで1フレームあたり1.4–2.2msの遅延で動作し、PCL(2786.0ms)やC&C(132.0ms)といったGPUベースのトラッカーを上回る遅延性能を示した。
  • 8コアのCPUを用いても、最大108個のオブジェクトを同時にトラッキングしながら30fpsのリアルタイム性能を維持した。
  • 1オブジェクトあたりのメモリフットプリントは40.5 MBにまで低減され、低コスト・低消費電力のハードウェアへの効率的デプロイが可能になった。
  • 図1の定性的な結果は、単純な形状から複雑な形状まで多様なオブジェクトが、部分的遮蔽や照明条件の変化といった困難な条件下でも、堅牢に動作することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。