Skip to main content
QUICK REVIEW

[論文レビュー] PointAtrousGraph: Deep Hierarchical Encoder-Decoder with Point Atrous Convolution for Unorganized 3D Points

Liang Pan, Chee–Meng Chew|arXiv (Cornell University)|Jul 23, 2019
3D Shape Modeling and Analysis参考文献 65被引用数 7
ひとこと要約

本稿では、点アトロウス畳み込み(PAC)を活用して受容 field を拡大し、複数スケールのエッジ特徴を捉えることで、順序に依存しない 3D ポイントクラウドのための階層的エンコーダデコーダーネットワークである PointAtrousGraph(PAG)を提案する。EP(エッジ保持プーリング)、EU(エッジ保持アンプーリング)、およびチェーン化されたスキップ接続を統合することにより、ダウンサンプリングおよびアップサンプリング中に重要な幾何的詳細を保持し、従来手法よりもメモリ消費量を低減し、推論速度を向上させながら、3Dセマンティックセグメンテーション、オブジェクト分類、パーツセグメンテーションで最先端の性能を達成する。

ABSTRACT

Motivated by the success of encoding multi-scale contextual information for image analysis, we propose our PointAtrousGraph (PAG) - a deep permutation-invariant hierarchical encoder-decoder for efficiently exploiting multi-scale edge features in point clouds. Our PAG is constructed by several novel modules, such as Point Atrous Convolution (PAC), Edge-preserved Pooling (EP) and Edge-preserved Unpooling (EU). Similar with atrous convolution, our PAC can effectively enlarge receptive fields of filters and thus densely learn multi-scale point features. Following the idea of non-overlapping max-pooling operations, we propose our EP to preserve critical edge features during subsampling. Correspondingly, our EU modules gradually recover spatial information for edge features. In addition, we introduce chained skip subsampling/upsampling modules that directly propagate edge features to the final stage. Particularly, our proposed auxiliary loss functions can further improve our performance. Experimental results show that our PAG outperform previous state-of-the-art methods on various 3D semantic perception applications.

研究の動機と目的

  • 無作為な 3D ポイントクラウドにおける複数スケールの局所的幾何的特徴を学習する課題に対処すること。
  • 従来のポイント畳み込み手法の受容 field が小さいために、小規模な局所的近傍に限定された文脈の捉え方を制限する問題を克服すること。
  • ダウンサンプリングおよびアップサンプリング中にエッジ特徴を保持する階層的エンコーダデコーダー・アーキテクチャを設計すること。
  • 周辺点グラフに依存するモデルと比較して、トレーニング時のメモリ消費量と推論時間を削減しつつ、性能を維持または向上させること。
  • MMD および深層監督損失の新たな補助損失関数を用いて、3D セマンティック認識タスクの性能を向上させること。

提案手法

  • アトロウス畳み込みをポイントクラウドに拡張するためのポイントアトロウス畳み込み(PAC)を提案。サンプリングレートを導入して隣接点を疎にサンプリングすることで、計算量を増加させずに有効な受容 field を拡大する。
  • 幾何的有意性に基づいて代表点を選択することで、重複のない最大プーリングの変種たるエッジ保持プーリング(EP)を導入。これにより、階層的ダウンサンプリング中に重要なエッジ特徴を保持する。
  • メトリック空間における最も近い保持点から特徴を伝搬することで、アップサンプリング時に空間的詳細を再構築するエッジ保持アンプーリング(EU)を提案。
  • 下位から上位のレベルへ直接特徴を伝えるチェーン化されたスキップサブサンプリング/アンプーリングモジュールを採用。これにより、長距離特徴の流れを維持し、情報損失を低減する。
  • 補助損失として、層間の特徴分布を揃えるための最大平均差異(MMD)損失と、トレーニングの安定化および特徴学習の向上を目的とした深層監督損失を統合。

実験結果

リサーチクエスチョン

  • RQ1無作為な 3D ポイントクラウドにおいて、階層的エンコーダデコーダー・アーキテクチャがエッジ詳細を保持しながら、複数スケールの局所的幾何的特徴を効果的に学習できるか。
  • RQ2アトロウス畳み込みの原則を 3D ポイントクラウドにどのように適応させれば、計算コストを増加させずに広範かつ柔軟な受容 field を実現できるか。
  • RQ3エッジ保持プーリングおよびアンプーリング操作は、標準的なプーリング手法と比較して、3D セマンティックセグメンテーションにおける特徴表現をどの程度向上させるか。
  • RQ4MMD や深層監督損失といった補助損失は、3D ポイントクラウドネットワークにおける特徴学習とモデル一般化能力を向上させることができるか。
  • RQ5提案されたアーキテクチャは、従来の周辺点グラフ依存モデルと比較して、より高い性能を発揮しながらも、より低いメモリ消費量と推論時間で実現できるか。

主な発見

  • PAG は、ShapeNet や S3DIS を含む複数のベンチマークで、3D セマンティックセグメンテーション、オブジェクト分類、パーツセグメンテーションにおいて最先端の性能を達成した。
  • DGCNN(275.4 ms、3.2M)および SpiderCNN(275.4 ms、3.2M)と比較して、推論時間が短く(109.8 ms)、パラメータ数も少ない(1.8M)ため、計算効率が向上していることが示された。
  • さまざまなサンプリングレートを用いた PAC の適用により、複数スケールの特徴学習が有効に実現された。実験では、特徴空間での特徴抽出がメトリック空間でのものよりも収束が速く、精度も優れていることが確認された。
  • エッジ保持プーリングおよびアンプーリング操作により、階層的処理中の幾何的詳細の損失が顕著に低減された。S3DIS および ShapeNet における定性的な結果によってその有効性が裏付けられた。
  • 補助損失としての MMD および深層監督損失は、特に細分化された構造を有する複雑な 3D シーンにおいて、トレーニングの安定性と性能向上に寄与した。
  • 非回転学習条件下でもモデルは頑健性を示し、最小限の変動で一貫した性能を発揮した。これは、優れた一般化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。