Skip to main content
QUICK REVIEW

[論文レビュー] RfD-Net: Point Scene Understanding by Semantic Instance Reconstruction

Yinyu Nie, Ji Hou|arXiv (Cornell University)|Nov 30, 2020
3D Shape Modeling and Analysis参考文献 68被引用数 8
ひとこと要約

RfD-Net は、グローバルな局所化とローカルな形状予測を分離することで、生の点群から直接3次元オブジェクトを検出するとともに、高密度メッシュを再構築する、エンドツーエンドの新規フレームワークである。スイーププロパゲーションモジュールと暗黙的関数学習を活用し、最先端の性能を達成しており、従来手法と比較してメッシュIoUを11%以上向上させるとともに、複数のバックボーンで一貫して3次元検出精度を向上させた。

ABSTRACT

Semantic scene understanding from point clouds is particularly challenging as the points reflect only a sparse set of the underlying 3D geometry. Previous works often convert point cloud into regular grids (e.g. voxels or bird-eye view images), and resort to grid-based convolutions for scene understanding. In this work, we introduce RfD-Net that jointly detects and reconstructs dense object surfaces directly from raw point clouds. Instead of representing scenes with regular grids, our method leverages the sparsity of point cloud data and focuses on predicting shapes that are recognized with high objectness. With this design, we decouple the instance reconstruction into global object localization and local shape prediction. It not only eases the difficulty of learning 2-D manifold surfaces from sparse 3D space, the point clouds in each object proposal convey shape details that support implicit function learning to reconstruct any high-resolution surfaces. Our experiments indicate that instance detection and reconstruction present complementary effects, where the shape prediction head shows consistent effects on improving object detection with modern 3D proposal network backbones. The qualitative and quantitative evaluations further demonstrate that our approach consistently outperforms the state-of-the-arts and improves over 11 of mesh IoU in object reconstruction.

研究の動機と目的

  • グリッドベースのディープラーニング手法の適用を妨げる、疎で不規則な点群からのセマンティックシーン理解の課題に対処すること。
  • 疎な点群から高解像度の暗黙的表面学習を可能にすることで、3次元形状再構築における解像度ボトルネックを克服すること。
  • 3次元オブジェクト検出と形状再構築の間で補完的な学習ループを確立し、両タスクのパフォーマンスを向上させること。
  • ボクセル化や2次元画像投影に依存せずに、インスタンスレベルのセマンティクス、ポーズ、完全なメッシュを直接予測するフレームワークを開発すること。
  • 多様な3次元検出バックボーンおよび入力の疎らかさの変動にさらされた共同学習の有効性を実証すること。

提案手法

  • RfD-Net は、3次元インスタンス検出と高密度表面再構築を分離する、再構築から検出へのパラダイムを採用している。
  • オブジェクト提案を高精度に生成する3次元プロポーザルネットワーク(例:VoteNet)を用い、その出力をローカルな形状予測の入力として利用する。
  • スイーププロパゲーションモジュールにより、検出された各オブジェクト周辺の点クラスタにプロポーザル特徴を転送し、空間的文脈を活用した局所的形状生成を可能にする。
  • 形状生成器は、インパルシットニューラル表現(例:マルチレイヤーパーセプトロン)を用いて、局所的な点クラスタから高解像度メッシュを予測する。
  • オブジェクトネスドロップアウトを適用して、低信頼度のプロポーザルをフィルタリングし、意味のある点クラスタのみを形状学習に使用する。
  • 検出と再構築の目的関数を統合したジョイント損失関数により、エンドツーエンドで訓練し、補完的な最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1独立した学習と比較して、3次元検出と形状再構築の共同学習は、両タスクのパフォーマンスを向上させることができるか?
  • RQ2生の点群から高密度メッシュを直接予測することは、ボクセルベースまたは画像ベースのベースラインを上回る性能を示すか?
  • RQ3提案されたスイーププロパゲーションモジュールは、再構築された表面の品質および検出精度にどのような影響を与えるか?
  • RQ4本手法は、入力点群の疎らかさの変動や、異なる3次元検出バックボーンアーキテクチャに対して、どの程度頑健であるか?
  • RQ5形状予測ヘッドは、多様な3次元検出ネットワークにおいて検出性能を向上させることができるか。逆に、検出ネットワークは形状予測性能を向上させることができるか?

主な発見

  • VoteNet をバックボーンとして用いた3次元検出ベンチマークで、mAP 35.10 を達成し、ベースラインを2.42ポイント上回った。
  • オブジェクト再構築において、最先端手法と比較して11%以上のメッシュIoU向上を達成し、優れた幾何的忠実性を示した。
  • 形状予測ヘッドを用いた共同学習は、BoxNet(+2.48 mAP)、MLCVNet(+1.37 mAP)、VoteNet+DGCNN(+2.42 mAP)を含む複数のバックボーンで、一貫して3次元検出性能を向上させた。
  • 疎な入力に対しても強力な性能を維持し、入力点数がたった20,000点の状態でも、mAP 33.89、メッシュIoU 14.39% を達成した。
  • アブレーションスタディの結果、点ノイズ除去を併用したスイーププロパゲーションモジュールが最良の結果をもたらし、プロポーザル特徴や点クラスタを省いた設定を上回った。
  • さまざまなオブジェクトネス閾値において一貫した改善が見られ、最適な性能は N_d = 10 で得られ、学習品質と効率のバランスが取れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。