Skip to main content
QUICK REVIEW

[論文レビュー] Style-based Point Generator with Adversarial Rendering for Point Cloud Completion

Chulin Xie, Chuxin Wang|arXiv (Cornell University)|Mar 3, 2021
3D Shape Modeling and Analysis参考文献 41被引用数 6
ひとこと要約

本稿では、特徴表現の向上のためのチャネルに注意を払った EdgeConv、形状生成の向上のためのスタイリスティックなフォールディング、および微分可能深度マップ投影による敵対的ポイントレンダリングを統合した新規な点群補完フレームワーク、SpareNet を提案する。本手法は、ShapeNet および KITTI で最先端の性能を達成し、定量的指標および視覚的品質の両面で先行手法を上回る。

ABSTRACT

In this paper, we proposed a novel Style-based Point Generator with Adversarial Rendering (SpareNet) for point cloud completion. Firstly, we present the channel-attentive EdgeConv to fully exploit the local structures as well as the global shape in point features. Secondly, we observe that the concatenation manner used by vanilla foldings limits its potential of generating a complex and faithful shape. Enlightened by the success of StyleGAN, we regard the shape feature as style code that modulates the normalization layers during the folding, which considerably enhances its capability. Thirdly, we realize that existing point supervisions, e.g., Chamfer Distance or Earth Mover's Distance, cannot faithfully reflect the perceptual quality of the reconstructed points. To address this, we propose to project the completed points to depth maps with a differentiable renderer and apply adversarial training to advocate the perceptual realism under different viewpoints. Comprehensive experiments on ShapeNet and KITTI prove the effectiveness of our method, which achieves state-of-the-art quantitative performance while offering superior visual quality.

研究の動機と目的

  • 部分入力からの微細構造および全体形状の保持に課題を抱える既存の点群補完手法の限界を解消すること。
  • 特徴の連結による制限により、通常のフォールディングモジュールの点生成におけるモデル化能力が制限されることを克服すること。
  • 標準の再構成損失の代わりに、レンダリングされた深度マップにおける敵対的学習を用いることで、視覚的品質を向上させること。
  • 局所的な幾何とグローバルなコンテキストを統合するエンドツーエンド学習を可能にし、より正確で現実的な補完を実現すること。

提案手法

  • 局所的な k 個の最近傍点特徴を集約し、グローバルコンテキストによって重み付けされたチャネル別アテンションを適用することで、特徴表現を豊かにするチャネルに注意を払った EdgeConv を導入する。
  • 学習された形状特徴がフォールディング MLP の正規化層を制御するスタイリスティックなフォールディングを提案し、標準の連結処理に代えて構造的詳細のモデリングを向上させる。
  • 生成された点群を複数の視点から深度マップに投影するための微分可能レンダラを用い、視覚的監視を実現する。
  • レンダリングされた深度マップの現実性を評価するディスクライマーを用いた敵対的学習を適用し、ジェネレータがより視覚的に妥当な出力を指向するように誘導する。
  • 粗い出力を複数段階にわたり段階的に改善する再帰的リファインメントモジュールを導入する。
  • 忠実度と視覚的品質の両立を図るため、再構成損失(Chamfer Distance、Earth Mover’s Distance)と敵対的損失を組み合わせる。

実験結果

リサーチクエスチョン

  • RQ1チャネルに注意を払った特徴学習は、点群補完における局所的およびグローバル構造の表現を向上させることができるか?
  • RQ2フォールディングにおける標準的な特徴連結をスタイリスティックなモodulation に置き換えることで、複雑で詳細な3次元形状の生成が向上するか?
  • RQ3微分可能な深度マップにおける敵対的学習は、標準の再構成損失を超えて、補完された点群の視覚的リアリズムを向上させることができるか?
  • RQ4チャネルアテンション、スタイリスティックなフォールディング、敵対的レンダリングの複数のコンポーネントの統合は、全体の補完品質にどのように影響を与えるか?

主な発見

  • 提案されたチャネルに注意を払った EdgeConv は、アテンションを導入しないベースラインと比較して、EMD が相対的に 12.5% 減少し、CD が 17.5% 減少することで、特徴表現の向上が顕著に示された。
  • スタイリスティックなフォールディングは収束が速く、構造的忠実性が向上し、通常のフォールディングと比較して FPD が 15% 向上し、EMD が 10% 減少した。
  • 最初のリファインメント出力に対して $w_{adv} = 0.1$ で敵対的レンダリングを適用した場合が最良のバランスを示し、非敵対的学習と比較して EMD が 10.2% 減少し、CD が 15.3% 減少した。
  • 再帰的リファインメントは補完の正確性を向上させ、2段階のリファインメントを備えた完全なモデルは EMD 1.898、CD 0.535 を達成し、ワンステップリファインメント(EMD 1.980、CD 0.593)を上回った。
  • アブレーションスタディの結果、チャネルアテンション、スタイリスティックなフォールディング、敵対的レンダリングのいずれかのコンponentを削除すると、すべての指標で一貫した性能低下が観察された。
  • 本手法は、ShapeNet および KITTI ベンチマークで最先端の性能を達成し、特に高解像度点群(16,384 点)において優れた視覚的品質と定量的結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。