Skip to main content
QUICK REVIEW

[論文レビュー] NeMo: Neural Mesh Models of Contrastive Features for Robust 3D Pose Estimation

Angtian Wang, Adam Kortylewski|arXiv (Cornell University)|Jan 29, 2021
3D Shape Modeling and Analysis参考文献 37被引用数 14
ひとこと要約

NeMoは、3次元メッシュ上で対照的ニューラル特徴マップを再構築することで3次元オブジェクトポーズを生成するニューラルメッシュモデルを提案する。微分可能レンダリングと対照的学習を用いることで、部分的遮蔽や未学習の視点に対しても頑健性を発揮する。PASCAL3D+およびObjectNet3Dにおいて、詳細な3次元形状がなくても正確な3次元ポーズ推定が可能であることを示しており、詳細な3次元形状が必須ではないことを実証している。

ABSTRACT

3D pose estimation is a challenging but important task in computer vision. In this work, we show that standard deep learning approaches to 3D pose estimation are not robust when objects are partially occluded or viewed from a previously unseen pose. Inspired by the robustness of generative vision models to partial occlusion, we propose to integrate deep neural networks with 3D generative representations of objects into a unified neural architecture that we term NeMo. In particular, NeMo learns a generative model of neural feature activations at each vertex on a dense 3D mesh. Using differentiable rendering we estimate the 3D object pose by minimizing the reconstruction error between NeMo and the feature representation of the target image. To avoid local optima in the reconstruction loss, we train the feature extractor to maximize the distance between the individual feature representations on the mesh using contrastive learning. Our extensive experiments on PASCAL3D+, occluded-PASCAL3D+ and ObjectNet3D show that NeMo is much more robust to partial occlusion and unseen pose compared to standard deep networks, while retaining competitive performance on regular data. Interestingly, our experiments also show that NeMo performs reasonably well even when the mesh representation only crudely approximates the true object geometry with a cuboid, hence revealing that the detailed 3D geometry is not needed for accurate 3D pose estimation. The code is publicly available at https://github.com/Angtian/NeMo.

研究の動機と目的

  • 部分的遮蔽や未学習のポーズ下で標準的なディープラーニング手法に見られる頑健性の欠如を解消すること。
  • 3次元メッシュ上での不変特徴表現を学習する生成的ニューラルメッシュモデルを構築し、色や形状の不要な変化からポーズを分離すること。
  • 詳細な幾何形状が粗く立方体に近似された場合でも、1つのプロトタイプメッシュを用いて頑健な3次元ポーズ推定を可能にすること。
  • インスタンス固有のメッシュモデルへの依存を減らすために、対照的学習を活用し、オブジェクト部品間で特徴を明確に分離する。

提案手法

  • NeMoは、オブジェクトカテゴリの幾何的事前知識として、プロトタイプの3次元メッシュ(例:立方体)を用いる。
  • CNNバックボーンと微分可能レンダリングを用いて、各メッシュ頂点におけるニューラル特徴活性化の生成モデルを学習する。
  • 対照的学習を適用し、オブジェクト部品と背景間の特徴距離を最大化することで、不要な変化に対する不変性を促進する。
  • 推論時、NeMoは入力画像から抽出した特徴とレンダリングされた特徴マップの再構築誤差を最小化することで3次元ポーズを推定する。
  • 局所最適解を避けるために、複数のランダムな初期ポーズシードからの勾配ベースの最適化を用いる。
  • 特徴がオブジェクト部品と背景で明確に分離されるよう、対照的損失を用いてエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1対照的特徴で訓練されたニューラルメッシュモデルは、部分的遮蔽下でも頑健な3次元ポーズ推定を達成できるか?
  • RQ2詳細なCADメッシュではなく、粗い幾何的近似(例:立方体)を用いることで、3次元ポーズ推定の性能が低下するか?
  • RQ3NeMoは、学習データに存在しなかった未学習の視点にどのように一般化するか?
  • RQ4対照的学習は、3次元ポーズ推定における特徴の明確さと頑健性をどの程度向上させるか?
  • RQ5インスタンス固有の3次元メッシュが不要な状況でも、NeMoは競争力のある性能を達成できるか?

主な発見

  • PASCAL3D+では、完全可視性(L0)下でπ/6の閾値で86.7%の精度を達成し、標準ベースラインを上回った。
  • 重度の遮蔽(L3)下でも、π/6の閾値で47.1%の精度を維持し、ベースラインが20%未満に低下するのとは対照的に顕著に優れた性能を示した。
  • 未学習のポーズ(側面視)では、π/6の閾値で63.2%の精度を達成し、学習済み視点の性能と同等であり、優れた一般化性能を示した。
  • アブレーション実験では、対照的学習を除去するとπ/6の閾値で精度が69.7%に低下し、特徴の明確さに果たすその重要性が浮き彫りになった。
  • 立方体メッシュを用いても、π/6の閾値で86.7%の精度を達成しており、詳細な幾何形状が必須でないことを示した。
  • ランダムなポーズ初期化を6回にとどめても、π/6の閾値で80.4%の精度を達成し、初期化への頑健性と滑らかな損失関数の形状を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。