Skip to main content
QUICK REVIEW

[論文レビュー] Neural 3D Morphable Models: Spiral Convolutional Networks for 3D Shape Representation Learning and Generation

Giorgos Bouritsas, Sergiy Bokhnyak|arXiv (Cornell University)|May 8, 2019
3D Shape Modeling and Analysis参考文献 58被引用数 147
ひとこと要約

この論文は、螺旋スキャンを用いてメッシュ上に直接階層的かつトポロジーに配慮した3D可変形状の表現を学習する、ニューラル3Dモーファブルモデル(Neural3DMM)という新しいフレームワークを紹介する。スパイラルスキャンによる一貫した局所頂点順序の維持により、グラフニューラルネットワークの置換不変性を破り、非等方的で軽量かつ効率的なメッシュ畳み込みを実現する。この手法は、人間の顔や体における3D形状再構築および生成の分野で、線形モーファブルモデルや先行のGNNよりも優れた性能を発揮する。

ABSTRACT

Generative models for 3D geometric data arise in many important applications in 3D computer vision and graphics. In this paper, we focus on 3D deformable shapes that share a common topological structure, such as human faces and bodies. Morphable Models and their variants, despite their linear formulation, have been widely used for shape representation, while most of the recently proposed nonlinear approaches resort to intermediate representations, such as 3D voxel grids or 2D views. In this work, we introduce a novel graph convolutional operator, acting directly on the 3D mesh, that explicitly models the inductive bias of the fixed underlying graph. This is achieved by enforcing consistent local orderings of the vertices of the graph, through the spiral operator, thus breaking the permutation invariance property that is adopted by all the prior work on Graph Neural Networks. Our operator comes by construction with desirable properties (anisotropic, topology-aware, lightweight, easy-to-optimise), and by using it as a building block for traditional deep generative architectures, we demonstrate state-of-the-art results on a variety of 3D shape datasets compared to the linear Morphable Model and other graph convolutional operators.

研究の動機と目的

  • 3D形状学習における置換不変性を持つグラフニューラルネットワークの制限を克服し、メッシュの固定トポロジーを明示的に符号化すること。
  • ボクセルや2D投影などの中間表現を経由せずに、直接メッシュ上で動作する3D可変形状の深層生成モデルを開発すること。
  • 線形3Dモーファブルモデルや既存のグラフ畳み込み演算子を改善し、固定トポロジーのメッシュ上で非線形で階層的な特徴抽出を可能にする。
  • エンドツーエンドのオートエンコーダーおよびGANを用いて、3D形状再構築および生成分野で最先端の性能を示すこと。

提案手法

  • スパイラルスキャンにより局所頂点の一貫した順序付けを実現する、新しいグラフ畳み込み演算子「スパイラル畳み込み」を提案。置換不変性を破り、メッシュ上での非等方的フィルタリングを可能にする。
  • スパイラルスキャンを用いて、隣接頂点と学習可能なフィルタパラメータの1対1対応を定義し、メッシュ上での非等方的フィルタリングを実現する。
  • スパイラル畳み込みを構築ブロックとして用いた階層的内在的メッシュオートエンコーダーを構築し、Neural3DMMフレームワークを形成する。
  • 公平な比較のため、COMAと同一のアーキテクチャを採用するが、表現能力を向上させるためにより大きなパラメータ空間を活用する。
  • 潜在空間のサンプリングに再パラメータ化トリックを用いた変分オートエンコーダーの目的関数に基づいてモデルを訓練する。
  • オートエンコーディングおよびGANベースの生成にこのフレームワークを適用し、潜在空間における形状算術およびアイデンティティ合成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1局所的な頂点順序を用いてメッシュトポロジーを明示的に符号化するグラフ畳み込み演算子は、置換不変性を持つGNNと比較して、3D形状表現学習を改善できるか?
  • RQ2スパイラル畳み込みに基づく階層的オートエンコーダーは、線形モーファブルモデルや先行のGNNベースのオートエンコーダーと比較して、より優れた3Dメッシュ再構築性能を達成できるか?
  • RQ3スパイラル畳み込みに基づくモデルは、詳細な幾何的特徴を備えたリアルな多様な3D顔アイデンティティを生成でき、従来の3DMMを上回る性能を発揮できるか?
  • RQ4学習された潜在空間は、補間、外挿、類推といった意味のある幾何的演算をどの程度サポートできるか?

主な発見

  • Neural3DMMは、COMA(顔)、Mein3D(顔)、DFAUST(体)を含む、すべてのテストデータセットで最先端の再構築誤差を達成し、PCA、3DMM、COMA、ChebNetベースのオートエンコーダーを上回る性能を発揮した。
  • 分散の85%を説明する潜在次元において、COMAに比べて平均再構築誤差を最大30%、PCAに比べて40%まで低減した。
  • 50,000以上の頂点を有する高密度メッシュを持つMein3Dデータセットでは、PCAは計算的に非現実的となるが、Neural3DMMははるかに少ないパラメータ数で高い性能を維持した。
  • モデルは高品質な形状算術を実現可能で、アイデンティティおよび表情の間で滑らかな補間と、顔の特徴を誇張する妥当な外挿を可能にした。
  • スパイラル畳み込み生成器を用いたGANベースの生成では、詳細な幾何的特徴を備えたリアルな3D顔が生成され、合成サンプルは実スキャンと区別がつかないほどであった。これに対して、3DMMの出力は滑らかで不自然な形状となる。
  • 分散の99%以上を説明する潜在空間でさえも、Neural3DMMはPCAを上回った。これは、より効率的かつ意味的に明確なパrameterizationに起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。