Skip to main content
QUICK REVIEW

[論文レビュー] W-PoseNet: Dense Correspondence Regularized Pixel Pair Pose Regression

Zelin Xu, Ke Chen|arXiv (Cornell University)|Dec 26, 2019
Robot Manipulation and Learning参考文献 46被引用数 16
ひとこと要約

本論文では、低ランク二重積プーリングと正規化された3次元座標への密な対応マッピングによる特徴の正則化を用いて、スパースなピクセルペアからポーズを回帰する新規な6次元物体ポーズ推定ネットワークW-PoseNetを提案する。YCB-VideoおよびLineMODベンチマークにおいて最先端の性能を達成し、微調整なしでDenseFusionを最大7%上回り、遮蔽下でも優れた耐性を示す。

ABSTRACT

Solving 6D pose estimation is non-trivial to cope with intrinsic appearance and shape variation and severe inter-object occlusion, and is made more challenging in light of extrinsic large illumination changes and low quality of the acquired data under an uncontrolled environment. This paper introduces a novel pose estimation algorithm W-PoseNet, which densely regresses from input data to 6D pose and also 3D coordinates in model space. In other words, local features learned for pose regression in our deep network are regularized by explicitly learning pixel-wise correspondence mapping onto 3D pose-sensitive coordinates as an auxiliary task. Moreover, a sparse pair combination of pixel-wise features and soft voting on pixel-pair pose predictions are designed to improve robustness to inconsistent and sparse local features. Experiment results on the popular YCB-Video and LineMOD benchmarks show that the proposed W-PoseNet consistently achieves superior performance to the state-of-the-art algorithms.

研究の動機と目的

  • RGB-D画像における遮蔽、対称性、テクスチャ変動の下での6次元物体ポーズ推定の課題に対処すること。
  • スパースなキーポoinト監督の代わりに、ピクセルから正規化された3次元座標への密な対応マッピングを用いることで、特徴の識別性と耐性を向上させること。
  • ピクセルペア間の相対的な幾何的およびテクスチャ的エンコードを用いて、局所的特徴を統合することで、グローバルなポーズ表現を強化すること。
  • ICPのような反復的微調整に依存しない、より強力なエンドツーエンド回帰ネットワークを設計することで、依存性を排除すること。
  • ピクセルペア特徴と対応関係の共同学習が、標準的なピxlsワイズ回帰よりも性能向上をもたらすことを実証すること。

提案手法

  • 2つのサンプリングされたピクセルからの特徴を組み合わせる低ランク二重積プーリング(LRBP)を用いたピクセルペアポーズ回帰モジュールを導入し、相対的な3次元幾何的および2次元テクスチャ的関係をエンコードする。
  • 各ピクセルの2次元画像座標を正規化された物体モデル空間内の3次元点に回帰する密な対応マッピング(DCM)ブランチを採用し、補助的監視を提供する。
  • ポーズ回帰損失とDCM損失を組み合わせたジョイント損失関数を用い、マルチタスク監視によるエンドツーエンド学習を可能にする。
  • 新しいコンponentsの貢献を明確にするために、DenseFusionと同一の密な特徴エンコーダーと統合モジュールを活用し、公平な比較を実現する。
  • 既存の最先端手法に準拠し、共通の微調整ネットワークを用いて反復的ポーズ微調整を適用し、さらなる性能向上を図る。

実験結果

リサーチクエスチョン

  • RQ1標準的なピxlsワイズ特徴回帰と比較して、ピクセルペア特徴エンコードは6次元ポーズ推定の耐性を向上させるか?
  • RQ2ピクセルから正規化された3次元座標への対応関係の学習は、特徴の識別性を向上させ、対称的ポーズによる曖昧性を低減するか?
  • RQ3ピクセルペア特徴とDCM監視の組み合わせは、遮蔽下における精度と耐性の観点で、既存手法と比較して優れているか?
  • RQ4提案手法は、ICPのような反復的微調整への依存度をどの程度低減できるか?
  • RQ5ポーズと対応関係の共同学習は、多様なベンチマーク全体で一貫した性能向上をもたらすか?

主な発見

  • 反復的微調整なしで、LineMODデータセットにおいてW-PoseNetは97.2%の平均ADD(S)を達成し、DenseFusion(93.2%対86.2%)を7%上回った。
  • YCB-Videoデータセットでは、遮蔽度が上昇する条件下でも、W-PoseNetはPoseCNN+ICPおよびDenseFusionを一貫して上回り、優れた耐性を示した。
  • アブレーションスタディの結果、ピクセルペアポーズ予測のみでも、DenseFusion(86.2%)に対して2%の性能向上(88.2%)を達成した。
  • 密な対応マッピング(DCM)ブランチ単体でも、DenseFusionに対して7%の性能向上を達成し、局所的特徴品質の向上に有効であることが証明された。
  • 特徴統合において、ELS、CON、LRBPのうち、低ランク二重積プーリング(LRBP)が最も優れた性能を示し、2次統計を効果的に捉えていることが確認された。
  • 反復的微調整を適用した場合、W-PoseNetはさらなる性能向上を達成した。これにより、提案されたアーキテクチャが既存の微調整パイプラインと互換性があり、それを強化できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。