Skip to main content
QUICK REVIEW

[論文レビュー] Pixel2Mesh++: Multi-View 3D Mesh Generation via Deformation

Chao Wen, Yinda Zhang|arXiv (Cornell University)|Aug 5, 2019
Advanced Vision and Imaging被引用数 9
ひとこと要約

本稿では、マルチビュー画像からの3Dメッシュ生成を改善するため、初期の粗いメッシュを視点間の知覚特徴統計を用いて反復的に変形するグラフ畳み込みネットワーク、Pixel2Mesh++を提案する。マルチビュー幾何学にインspiredされ、微分可能でないargmaxの近似としての微分可能なソフトargmaxと、統計的特徴プーリングを用いることで、エンドツーエンドの学習を可能にし、カテゴリ、ビュー数、初期化品質の面で優れた一般化性能を達成する、最先端の性能を実現する。

ABSTRACT

We study the problem of shape generation in 3D mesh representation from a few color images with known camera poses. While many previous works learn to hallucinate the shape directly from priors, we resort to further improving the shape quality by leveraging cross-view information with a graph convolutional network. Instead of building a direct mapping function from images to 3D shape, our model learns to predict series of deformations to improve a coarse shape iteratively. Inspired by traditional multiple view geometry methods, our network samples nearby area around the initial mesh's vertex locations and reasons an optimal deformation using perceptual feature statistics built from multiple input images. Extensive experiments show that our model produces accurate 3D shape that are not only visually plausible from the input perspectives, but also well aligned to arbitrary viewpoints. With the help of physically driven architecture, our model also exhibits generalization capability across different semantic categories, number of input images, and quality of mesh initialization.

研究の動機と目的

  • 視覚的領域の遮蔽領域における不良な幾何構造や、意味的カテゴリにわたる一般化性能の低さといった、単一ビュー3Dメッシュ生成の限界を解決する。
  • カメラポーズが既知の3〜5枚の入力画像から得られるマルチビュー情報を利用することで、形状の正確性とビューの一貫性を向上させる。
  • 単一画像モデルの単純なマルチビュー拡張では、マルチビュー相関を効果的に活用できないという欠点を克服する。
  • 微分可能で物理的インスピレーションを受ける変形メカニズムを用いることで、入力ビュー数の可変性と初期メッシュの質の低さに対してもロバストなエンドツーエンド学習を可能にする。
  • 再トレーニングを必要とせず、反復的メッシュ精錬によって幾何的品質を段階的に向上させる。

提案手法

  • 複数の入力画像からプールされた特徴を用いて、初期の粗いメッシュ上で反復的頂点変形を実行するマルチビュー変形ネットワーク(MDN)を提案する。
  • 変形仮説選択における非微分可能なargmaxを近似するため、微分可能な3次元ソフトargmaxを用い、エンドツーエンドバックプロパゲーションを可能にする。
  • 入力順序および入力数に不変な特徴プーリングとして、平均、最大値、標準偏差を用いた統計的特徴プーリングを採用し、視点間の特徴相関を符号化する。
  • 変形されたメッシュ面に点を再サンプリングする再サンプリング・チェンファーディスタンス損失を導入し、疎なまたは不規則なメッシュ領域における誤差をより効果的にペナルティ化する。
  • グラフ畳み込みネットワーク(GCN)を活用して、メッシュ頂点間で変形信号を伝搬させ、精錬中にメッシュトポロジーを維持する。
  • 特徴の連結ではなく統計ベースの特徴集約を用いることで、1回のフォワードパスで任意の数の入力ビューをサポートする。

実験結果

リサーチクエスチョン

  • RQ1複数の画像からの視点間情報は、単一ビューの事前知識を上回る3Dメッシュ生成を改善するために効果的に活用可能か?
  • RQ2深層学習モデルは、微分可能で一般化可能であるとともに、マルチビュー制約を用いて反復的に粗いメッシュを精錬できるようにどのように設計できるか?
  • RQ3入力ビュー数の変動や初期メッシュの質の低さに対してロバストであるためには、どのようなアーキテクチャ的要素が必要か?
  • RQ4複数のビューからの知覚特徴統計を用いることで、直接的な特徴連結と比較して、意味的カテゴリやビュー数にわたる一般化性能が向上するか?
  • RQ5変形による反復的精錬は、単一ステップ予測手法と比較して、メッシュ品質を顕著に向上させられるか?

主な発見

  • Pixel2Mesh++は、3枚の入力ビューを用いてShapeNetで最先端の性能を達成し、F-score(τ)が66.48%、F-score(2τ)が80.30%を記録し、先行手法を上回る。
  • 入力ビュー数を増やすと一貫した性能向上を示し、5枚のビューを用いることでF-score(τ)が68.29%、F-score(2τ)が81.97%に向上し、優れたスケーラビリティを示している。
  • 再サンプリング・チェンファーディスタンス損失により、再サンプリングなしの場合のチェンファーディスタンス0.496から0.486に低下し、特に疎な領域でのメッシュ忠実度の向上が顕著に確認された。
  • 統計的特徴プーリングは連結法よりも性能を向上させ、66.48%(F-score(τ))を達成した一方で、原始的特徴連結では65.26%にとどまり、より優れた不変性と相関符号化が可能だった。
  • 反復的精錬により性能が向上し、3回の反復で指標が飽和したため、最適な結果を得るには3回の反復で十分であることが示された。
  • ノイズの多いまたは初期化が悪い場合でも良好に一般化する。ランダムノイズの除去や歪んだメッシュの正規化が正しく行われ、初期化品質へのロバストネスが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。