[論文レビュー] 6D Object Pose Estimation without PnP
本稿では、トレーニング中に3次元バウンディングボックスコーナーの2次元投影を回帰するためのコリニアリティ方程式層を導入することで、PnPアルゴリズムを回避するエンドツーエンドの6次元オブジェクトポーズ推定手法を提案する。推論時に直接6次元ポーズを予測可能となり、GTX 1080Tiで1インスタンスあたり18 msのリアルタイム性能を達成し、LineModデータセットでは1.67 cm未満の並進誤差と2.5°未満の回転誤差を達成。最先端手法に比して精度と効率の両面で優れている。
In this paper, we propose an efficient end-to-end algorithm to tackle the problem of estimating the 6D pose of objects from a single RGB image. Our system trains a fully convolutional network to regress the 3D rotation and the 3D translation in region layer. On this basis, a special layer, Collinear Equation Layer, is added next to region layer to output the 2D projections of the 3D bounding boxs corners. In the back propagation stage, the 6D pose network are adjusted according to the error of the 2D projections. In the detection phase, we directly output the position and pose through the region layer. Besides, we introduce a novel and concise representation of 3D rotation to make the regression more precise and easier. Experiments show that our method outperforms base-line and state of the art methods both at accuracy and efficiency. In the LineMod dataset, our algorithm achieves less than 18 ms/object on a GeForce GTX 1080Ti GPU, while the translational error and rotational error are less than 1.67 cm and 2.5 degree.
研究の動機と目的
- 6次元オブジェクトポーズ推定におけるPnPアルゴリズムの計算コストと誤差伝搬を低減すること。
- 単一のRGB画像からエンドツーエンドのディープラーニングフレームワークを用いてリアルタイムかつ高精度な6次元ポーズ予測を可能にすること。
- 新規な3次元回転表現と微分可能なコリニアリティ制約層を導入することで、回帰の安定性と精度を向上させること。
- 後処理の精練や深度センサーを一切使用せずに高精度な6次元ポーズ推定を達成すること。
- YOLOv2を拡張し、高インファレンス速度を維持したまま直接6次元ポーズ予測を可能にすること。
提案手法
- 完全畳み込みネットワークを用い、領域層内で3次元並進(tu, tv, tw)および3次元回転(a, b, c)パラメータを直接回帰する。
- 3次元バウンディングボックスコーナーの2次元投影を予測するための新規なコリニアリティ方程式層を導入し、コリニアリティ制約によって幾何的整合性を強制する。
- 誤差逆伝播では2次元コーナー投影の誤差を用いてネットワークを更新し、PnPを必要としないエンドツーエンド学習を実現する。
- 推論時、コリニアリティ方程式層は無視され、6次元ポーズは領域層から直接出力されるため、PnP計算が不要になる。
- 回帰の簡素化と収束性・精度の向上を図るため、新規な3次元回転表現を提案する。
- 6次元ポーズと2次元コーナー投影の両方を監視対象としてRGB画像で学習することで、共同最適化を可能にする。
実験結果
リサーチクエスチョン
- RQ1PnPアルゴリズムに依存せずに6次元オブジェクトポーズ推定を実現できるか。これにより推論速度が向上し、誤差伝搬が低減するか?
- RQ23次元ボックスコーナーのコリニアリティといった幾何的制約を、微分可能層として統合することで、回帰精度が向上するか?
- RQ3新規な3次元回転表現が、エンドツーエンドの6次元ポーズ回帰の安定性と精度を向上させるか?
- RQ4単一のRGB画像からの直接6次元ポーズ予測が、BB8のようなマルチステージ手法に比して速度と精度の両面で優れるか?
- RQ5提案手法が多様なオブジェクトカテゴリに一般化可能であり、一般消費者向けGPUでもリアルタイム性能を達成できるか?
主な発見
- VOC3Dデータセットでは平均2次元投影誤差が0.928ピxlsであり、GTX 1080Tiで55 FPSの推論速度を達成した。
- LineModデータセットでは並進誤差が1.67 cm未満、回転誤差が2.5度未満であった。
- 平均推論時間は1オブジェクトあたり17 msであり、BB8(130 ms)とSSD-6D(20 ms)を上回る速度性能を示した。
- 全評価オブジェクトにおいて、2次元投影誤差および6次元ポーズ精度の両面でBB8およびSS6Dを上回った。
- コリニアリティ方程式層の導入により、独立した2次元コーナー回帰に比べて一般化性能が向上し、誤差分散が低減した。
- 後処理の精練なしに高い精度を達成しており、ロバスト性とエンドツーエンド最適化の有効性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。