Skip to main content
QUICK REVIEW

[論文レビュー] Implicit 3D Orientation Learning for 6D Object Detection from RGB Images

Martin Sundermeyer, Zoltán-Csaba Márton|arXiv (Cornell University)|Feb 4, 2019
Advanced Neural Network Applications参考文献 38被引用数 5
ひとこと要約

本論文は、ドメインランダマイゼーションを用いて合成RGBビューで訓練された拡張オートエンコーダー(AAE)を用いた、実際のポーズアノテーション付きデータを必要としない、暗黙的3次元姿勢推定手法を提案する。この手法により、リアルタイムでの6次元オブジェクト検出が可能となり、T-LESSでは最先端の性能を達成し、LineMODでも競争力のある結果を示す。視覚的補正とICPの最適化により、性能が向上する。

ABSTRACT

We propose a real-time RGB-based pipeline for object detection and 6D pose estimation. Our novel 3D orientation estimation is based on a variant of the Denoising Autoencoder that is trained on simulated views of a 3D model using Domain Randomization. This so-called Augmented Autoencoder has several advantages over existing methods: It does not require real, pose-annotated training data, generalizes to various test sensors and inherently handles object and view symmetries. Instead of learning an explicit mapping from input images to object poses, it provides an implicit representation of object orientations defined by samples in a latent space. Our pipeline achieves state-of-the-art performance on the T-LESS dataset both in the RGB and RGB-D domain. We also evaluate on the LineMOD dataset where we can compete with other synthetically trained approaches. We further increase performance by correcting 3D orientation estimates to account for perspective errors when the object deviates from the image center and show extended results.

研究の動機と目的

  • 実際のポーズアノテーション付き学習データを必要としない、RGBオンリーのリアルタイム6次元オブジェクト検出パイプラインの開発。
  • オブジェクトの対称性、遮蔽、合成画像から実画像へのドメインシフトといった課題への対処。
  • SO(3) やクaternionへの明示的マッピングを避けることで、潜在空間における暗黙的表現学習による頑健な3次元姿勢推定の実現。
  • 視覚的補正と深度ベースのICP最適化を用いて、中心からずれたオブジェクトの精度向上。
  • 埋め込みハードウェア上でのセンサーや実世界の照明条件の多様性にわたる一般化の検証。

提案手法

  • 3次元モデルの合成RGB画像に、ランダムな補正(色、幾何、照明)を施した、変種のノイズ除去オートエンコーダー(AAE)を訓練。
  • 学習中にドメインランダマイゼーションを用いて、実世界の変動をシミュレートし、シミュレーションから実世界へのドメインギャップを埋める。
  • SO(3) やクォータニオンへの明示的マッピングを伴わず、3次元オブジェクトの姿勢を潜在空間に暗黙的に符号化する表現を学習。
  • 2次元オブジェクト検出器(例:SSD)を用いてオブジェクトを局所化・クロップし、その後にAAE推論を実行して3次元姿勢を推定。
  • オブジェクトが画像平面で中心からずれている場合の深度スケーリング誤差を低減するため、視覚的補正を適用。
  • 深度データに対して反復最密点法(ICP)を適用し、6次元姿勢推定をさらに最適化。RGB-D入力において精度が向上する。

実験結果

リサーチクエスチョン

  • RQ1合成3次元モデルのビューで訓練された自己教師付きオートエンコーダーが、実際のポーズアノテーション付きデータを必要とせずに、頑健な3次元姿勢推定を達成できるか?
  • RQ2AAEは、実世界のテスト画像や多様なセンサに一般化できるか。特にドメインシフトの下でも性能を維持できるか?
  • RQ3AAEの暗黙的潜在表現は、明示的な対称性モデリングを伴わず、対称的オブジェクトのビューを自然に処理できるか?
  • RQ4視覚的補正により、画像中央からずれたオブジェクトの6次元姿勢精度が向上するか?
  • RQ5T-LESS や LineMOD といったベンチマークデータセットにおいて、最先端の手法と比較して本手法の性能はどの程度か?

主な発見

  • T-LESS データセットにおいて、RGBおよびRGB-D設定の両方で、従来の合成データで学習した手法を上回る最先端の性能を達成した。
  • LineMOD データセットでは、RGBオンリーの領域で競争力のある結果を示し、ICP最適化なしのSSD6Dを上回った。
  • 視覚的補正の追加により、中心からずれたオブジェクトの深度推定誤差が顕著に低減され、全体の6次元姿勢精度が向上した。
  • ICP最適化により、特に遮蔽状態の下でも並進推定精度が向上したが、回転推定値は安定したままだった。
  • Jetson TX2上で13 FPSを超える速度で実行され、実世界の照明条件やセンサの変動に対してもリアルタイム性能と頑健性を示した。
  • 本手法は、さまざまなセンサや実世界の環境条件に対しても良好に一般化でき、制御されたラボ環境外でのライブデモにより検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。