Skip to main content
QUICK REVIEW

[論文レビュー] Cerberus: A Multi-headed Derenderer

Boyang Deng, Simon Kornblith|arXiv (Cornell University)|May 28, 2019
Human Pose and Action Recognition参考文献 44被引用数 6
ひとこと要約

Cerberusは、パーツアノテーションなしで、視点やポーズの変化に対して幾何的不変性を課すことによって、1枚の画像から3次元可動物体を再構築するマルチヘッドのデレンダラーを提案する。微分可能3次元レンダラーと新しいトレーニング戦略を用い、意味的に意味のある、転送可能なパーツを発見し、人間および動物のデータセットにおいて、新しいポーズへのゼロショット一般化が極めて高い水準で達成されている。

ABSTRACT

To generalize to novel visual scenes with new viewpoints and new object poses, a visual system needs representations of the shapes of the parts of an object that are invariant to changes in viewpoint or pose. 3D graphics representations disentangle visual factors such as viewpoints and lighting from object structure in a natural way. It is possible to learn to invert the process that converts 3D graphics representations into 2D images, provided the 3D graphics representations are available as labels. When only the unlabeled images are available, however, learning to derender is much harder. We consider a simple model which is just a set of free floating parts. Each part has its own relation to the camera and its own triangular mesh which can be deformed to model the shape of the part. At test time, a neural network looks at a single image and extracts the shapes of the parts and their relations to the camera. Each part can be viewed as one head of a multi-headed derenderer. During training, the extracted parts are used as input to a differentiable 3D renderer and the reconstruction error is backpropagated to train the neural net. We make the learning task easier by encouraging the deformations of the part meshes to be invariant to changes in viewpoint and invariant to the changes in the relative positions of the parts that occur when the pose of an articulated body changes. Cerberus, our multi-headed derenderer, outperforms previous methods for extracting 3D parts from single images without part annotations, and it does quite well at extracting natural parts of human figures.

研究の動機と目的

  • パーツレベルの監視なしに、1枚の画像から可動体の3次元パーツベースの表現を学習すること。
  • 形状、ポーズ、視点の因子を分離することで、新しい視点、照明、ポーズへの一般化を向上させること。
  • 自己教師付きの一貫性制約を通じて、意味的に意味のあるパーツ(例:頭部、四肢)を発見すること。
  • 同じ被験者における多様なポーズ間で、パーツモデルをゼロショットで転送可能にする仕組みを提供すること。
  • 自然な幾何的不変性を活用した、スケーラブルで微分可能な、非教師付き3次元認識フレームワークの構築

提案手法

  • Cerberusは、N個の自由に浮遊する3次元パーツを予測するニューラルネットワークを用いる。各パーツは独自の三角メッシュと、カメラからの相対的ポーズ(回転と並進)を持つ。
  • 各パーツは学習された形状パラメータで変形され、全3次元モデルは微分可能な3次元レンダラーを用いてレンダリングされ、ピクセル領域の再構築誤差が計算される。
  • モデルは、アーチェクチャの変化に伴う視点や相対的ポーズの変化に対して、パーツの変形が不変であることを保証する、新しい一貫性制約を用いてトレーニングされる。
  • 再構築誤差が微分可能なレンダラーを介してバックプロパゲーションされ、ネットワークはエンドツーエンドで最適化される。
  • 主なイノベーションの1つは、アイデンティティ条件付き再構築の使用である:標準ポーズから抽出したパーツを、同じ被験者の他のポーズに適用することで、転送性をテストする。
  • アーキテクチャは、オブジェクトレベルの潜在表現のためのグローバル平均プーリングを備えたU-Netに類似したエンコーダーデコーダー構造を採用し、クaternionベースのポーズ予測を実装する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークは、パーツアノテーションなしで、1枚の画像から意味的に意味のある3次元パーツを抽出できるか?
  • RQ2視点とポーズの変化における幾何的不変性は、パーツ発見の強力な自己教師信号として機能するか?
  • RQ3ポーズ間でのパーツ形状の一貫性を強制することで、新しいポーズへの一般化が向上するか?
  • RQ4マルチヘッドのデレンダラーは、単一メッシュの再構築モデルに比べ、3次元再構築およびパーツセグメンテーションで優れた性能を発揮するか?
  • RQ51枚の画像から抽出した1つのパーツセットが、同じ被験者の他のポーズの再構築にどの程度転送可能か?

主な発見

  • Cerberusは、人間および動物のデータセットにおいて、パーツアノテーションなしでも、すべてのベースラインを上回る3次元再構築およびパーツセグメンテーション性能を達成している。
  • 挑戦的な「Hard Human」ベンチマークでは、1つの標準ポーズから得たパーツを他のポーズに転送する状況でも、Cerberusは高い性能を維持しており、ボクセルIoUがすべてのベースラインを大きく上回っている。
  • アブレーションスタディの結果、ポーズの一貫性制約を削除すると、Hard Humanベンチマークでの性能が著しく低下することが確認され、この制約が転送可能なパーツを学習する上で極めて重要な役割を果たしていることが示された。
  • Free Cerberus(ポーズ一貫性なし)は、標準評価では高い精度を達成するが、ポーズ間での一般化に失敗し、しばしば脚を1つのパーツに統合してしまう。一方、Cerberusは正しく四肢を別々のパーツとしてセグメンテーションしている。
  • Cerberusは、多様な動物において一貫性があり、形状に適したパーツを学習している。例えば、デリケートな鼻先(シロナガスクジラ)から丸みを帯びた鼻先(ハイエナ)へと適応する頭部パーツは、意味的整合性を保っている。
  • 本手法は、新しい視点、照明条件、ポーズに対しても良好に一般化しており、再構築された3次元モデルから新たな画像をレンダリングすることで実証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。