[論文レビュー] Unsupervised 3D Shape Learning from Image Collections in the Wild
本稿では、ラベル付け、テンプレート、3次元の監視情報が一切不要な、完全に教師なしの3次元形状およびテクスチャの学習手法を提案する。生成対抗ネットワーク(GAN)と微分可能レンダラを用いて、現実的で3次元的なオブジェクトとビューを合成するモデルを訓練する。本手法は、実データおよび合成データにおいて、最先端の教師なし3次元再構成を達成する。
We present a method to learn the 3D surface of objects directly from a collection of images. Previous work achieved this capability by exploiting additional manual annotation, such as object pose, 3D surface templates, temporal continuity of videos, manually selected landmarks, and foreground/background masks. In contrast, our method does not make use of any such annotation. Rather, it builds a generative model, a convolutional neural network, which, given a noise vector sample, outputs the 3D surface and texture of an object and a background image. These 3 components combined with an additional random viewpoint vector are then fed to a differential renderer to produce a view of the sampled object and background. Our general principle is that if the output of the renderer, the generated image, is realistic, then its input, the generated 3D and texture, should also be realistic. To achieve realism, the generative model is trained adversarially against a discriminator that tries to distinguish between the output of the renderer and real images from the given data set. Moreover, our generative model can be paired with an encoder and trained as an autoencoder, to automatically extract the 3D shape, texture and pose of the object in an image. Our trained generative model and encoder show promising results both on real and synthetic data, which demonstrate for the first time that fully unsupervised 3D learning from image collections is possible.
研究の動機と目的
- 未対応の2次元画像コレクションから、手動のラベル付けや3次元テンプレートが一切不要な3次元形状およびテクスチャの再構成を可能にすること。
- 従来の3次元再構成手法で一般的に用いられるポーズ、ランドマーク、マスク、動画シーケンスに依存しないこと。
- 微分可能レンダラを用いた敵対的訓練により、画像データから直接3次元構造を学ぶ生成モデルの開発。
- 敵対的リアリズムによる視覚的一致性を強制することで、画像データのみから現実的な3次元形状を学習可能であることを示すこと。
- CelebA(実データ)およびShapeNet(合成データ)の両データセット上で本手法を検証し、完全に教師なしの3次元学習の可能性を示すこと。
提案手法
- ノイズベクトルを3次元メッシュ、テクスチャ、背景画像にマップする生成モデルを訓練する。
- 微分可能レンダラを用いて、生成された3次元オブジェクトと視点ベクトルから新たなビューを合成する。
- 実画像とレンダリング画像を区別するためのディスクラミネータに対して、生成器を敵対的に訓練する。
- 滑らかさ損失($\mathcal{L}_S$)を統合し、三角形法線の滑らかでない部分をペナルティ化することで、3次元メッシュの高周波数アーティファクトを低減する。
- 1枚の入力画像から3次元形状、テクスチャ、ポーズを推論するエンコーダーをオートエンコーダー構成として訓練する。
- 視点のサンプリングを用いて多様なビューをカバーするように、組み合わせられた目的関数:$\mathcal{L}_{GAN}(G,D) + \lambda_S \mathcal{L}_S(G)$ を最適化する。
実験結果
リサーチクエスチョン
- RQ1ラベル付けやテンプレート、監視情報が一切ない状態で、未対応の2次元画像から3次元形状を学習することは可能か?
- RQ2画像レベルのリアリズムのみを監視信号として用いることで、現実的な3次元オブジェクトとビューを生成する生成モデルを訓練することは可能か?
- RQ3生成された3次元メッシュにおける高周波数アーティファクトは、どのようにして軽減できるか?
- RQ4本モデルは、オブジェクトカテゴリに関する事前知識なしに、CelebAのような実世界の画像コレクションにどの程度一般化可能か?
- RQ5オートエンコーダー部は、完全に教師なしの状態で、1枚の画像から3次元形状、テクスチャ、ポーズを効果的に再構成できるか?
主な発見
- 本手法は、ラベル付けが一切ないCelebAデータセットにおいても、妥当な3次元形状およびテクスチャの再構成を達成し、完全に教師なしの3次元学習の可能性を示した。
- 滑らかさ損失($\mathcal{L}_S$)の導入により、3次元メッシュの高周波数アーティファクトが顕著に低減されたが、鼻や唇といった主要な顔貌特徴は保持された。
- 滑らかさ損失なしでは、生成された3次元メッシュに顕著な高周波数ノイズが見られたが、過剰に滑らかにするとモデルが平均的な楕円体形状に収束した。
- オートエンコーダーの変種は、教師あり手法に比べて詳細にやや劣るが、1枚の画像から3次元形状とテクスチャを効果的に再構成できた。
- 物体サイズを制約することで、中空マスクの曖昧性を緩和し、径方向の拡大が閾値を超えた場合にリサイズを実施した。
- ShapeNetの車両カテゴリにおいて、本手法は合成データに完全に一般化でき、360°の全ビューをレンダリングする能力を示し、異なるデータセット間での頑健性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。