Skip to main content
QUICK REVIEW

[論文レビュー] Learning Shape Priors for Single-View 3D Completion and Reconstruction

Jiajun Wu, Chengkai Zhang|arXiv (Cornell University)|Sep 13, 2018
Advanced Vision and Imaging参考文献 51被引用数 13
ひとこと要約

本論文では、敵対的に学習された形状事前分布を統合することで、1枚の視点からの3次元形状補完および再構成を向上させる深層生成モデルShapeHDを提案する。真の形状からのずれではなく、現実的でない形状のみをペナルティ化することで、構造的曖昧性とぼんやりとした平均形状への傾向という2つの問題を克服し、100ms未満の推論時間で高精細で詳細な再構成を達成し、最先端の性能を実現する。

ABSTRACT

The problem of single-view 3D shape completion or reconstruction is challenging, because among the many possible shapes that explain an observation, most are implausible and do not correspond to natural objects. Recent research in the field has tackled this problem by exploiting the expressiveness of deep convolutional networks. In fact, there is another level of ambiguity that is often overlooked: among plausible shapes, there are still multiple shapes that fit the 2D image equally well; i.e., the ground truth shape is non-deterministic given a single-view input. Existing fully supervised approaches fail to address this issue, and often produce blurry mean shapes with smooth surfaces but no fine details. In this paper, we propose ShapeHD, pushing the limit of single-view shape completion and reconstruction by integrating deep generative models with adversarially learned shape priors. The learned priors serve as a regularizer, penalizing the model only if its output is unrealistic, not if it deviates from the ground truth. Our design thus overcomes both levels of ambiguity aforementioned. Experiments demonstrate that ShapeHD outperforms state of the art by a large margin in both shape completion and shape reconstruction on multiple real datasets.

研究の動機と目的

  • 2次元観測から3次元形状を推定する際の不適切な性質と、1つの入力に対して複数の妥当で現実的な形状が存在するという2重の曖昧性に対処すること。
  • 真の形状が非決定的であるため、ぼんやりとした平均形状の出力を生成する完全に教師ありの手法の限界を克服すること。
  • 現実的で詳細な形状を平均形状や非現実的な形状よりも好む、敵対的に学習された自然さ事前分布を統合することで、3次元形状補完および再構成を改善すること。
  • 100ms未満の推論時間で高品質で詳細な3次元再構成を効率的に達成し、実用的導入に適すること。

提案手法

  • ShapeHDは、1枚のRGBまたは深度画像から3次元ボクセルグリッドを予測するために、深層ボリュメトリック畳み込みエンコーダ-デコーダーネットワークを採用する。
  • 現実的でない3次元形状を区別する敵対的ディスクラミネーターを介して学習された自然さ損失を導入し、生成器が現実的で詳細な出力を生成するよう促進する。
  • ボクセル単位の再構成損失(例:バイナリクロスエントロピーまたはL1)と敵対的損失の組み合わせにより、エンドツーエンドで訓練され、忠実度と自然さのバランスを取る。
  • 敵対的訓練部は、真の形状からのずれではなく、現実的でない形状のみをペナルティ化する正則化子として機能し、2番目の曖昧性レベルを解消する。
  • 活性化可視化を通じて、車輪、いすの脚、飛行機エンジンなどの物体部品を検出する部分検出器をネットワークが暗黙的に学習する。
  • 細かい形状の詳細は、標準的な再構成損失が見逃す小さな高重み領域に焦点を当てる自然さ損失により回復される。

実験結果

リサーチクエスチョン

  • RQ1敵対的に学習された形状事前分布は、1枚の視点入力からの3次元形状再構成の現実性と詳細性を向上させることができるか?
  • RQ23次元形状補完における非決定的性質を扱う際、本モデルは教師ありベースラインと比較してどのように性能を発揮するか?
  • RQ3学習された事前分布は、平均形状出力が捉えられない細かい構造的詳細を回復するのにどの程度有効か?
  • RQ4モデルは物体カテゴリをまたいで一般化可能か?変形可能な部品やレアな部品に対しても効果的に対処できるか?
  • RQ5自然さ損失は、訓練過程における形状の詳細の進化にどのように影響を与えるか?

主な発見

  • ShapeHDは、32³解像度におけるShapeNetデータセットで、3D形状補完および再構成の両面で最先端の手法を上回り、IoUが0.284を達成した。
  • Pix3Dデータセットでは、Chamfer Distanceが0.123を達成し、3D-R2N2(0.239)、DRC(0.160)、PSGN(0.199)を顕著に上回った。
  • 人間の好みの評価では、OGNと比較してShapeHDの再構成が64.5%の割合で好まれ、飛行機のケースでは59%、車のケースでは35%の好まれ率を示した。
  • 特徴マップの可視化により、車の車輪、いすの背もたれ、飛行機エンジンといった意味のある物体部品をネットワークが検出していることが確認された。
  • 自然さ損失により、訓練時間に伴い形状の細部が段階的に追加されることが、形状の進化可視化で示されたが、標準的な再構成損失のみではこのような詳細の回復に失敗した。
  • 失敗事例から、非常に細い構造、変形可能な部品(例:回転する車輪)、車輪の上にリングがあるようなレアな特徴の処理に限界があることが判明し、形状の複雑さやスパarsityに敏感であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。