Skip to main content
QUICK REVIEW

[論文レビュー] JSNet: Joint Instance and Semantic Segmentation of 3D Point Clouds

Lin Zhao, Wenbing Tao|arXiv (Cornell University)|Dec 20, 2019
3D Shape Modeling and Analysis参考文献 34被引用数 12
ひとこと要約

JSNetは、特徴抽出の共有バックボーンと特徴融合に加え、タスク間の相互強化を可能にする新規な共同インスタンスおよびセマンティックセグメンテーション(JISS)モジュールを活用することで、ポイントクラウドのエンドツーエンドのディーブラーニングフレームワークを提案する。本手法はS3DISで最先端の性能を達成し、インスタンスセグメンテーションとセマンティックセグメンテーションのそれぞれで62.9% mPrecおよび55.0% mIoUを達成しており、先行手法を上回っている。

ABSTRACT

In this paper, we propose a novel joint instance and semantic segmentation approach, which is called JSNet, in order to address the instance and semantic segmentation of 3D point clouds simultaneously. Firstly, we build an effective backbone network to extract robust features from the raw point clouds. Secondly, to obtain more discriminative features, a point cloud feature fusion module is proposed to fuse the different layer features of the backbone network. Furthermore, a joint instance semantic segmentation module is developed to transform semantic features into instance embedding space, and then the transformed features are further fused with instance features to facilitate instance segmentation. Meanwhile, this module also aggregates instance features into semantic feature space to promote semantic segmentation. Finally, the instance predictions are generated by applying a simple mean-shift clustering on instance embeddings. As a result, we evaluate the proposed JSNet on a large-scale 3D indoor point cloud dataset S3DIS and a part dataset ShapeNet, and compare it with existing approaches. Experimental results demonstrate our approach outperforms the state-of-the-art method in 3D instance segmentation with a significant improvement in 3D semantic prediction and our method is also beneficial for part segmentation. The source code for this work is available at https://github.com/dlinzhao/JSNet.

研究の動機と目的

  • 3Dインスタンスセグメンテーションとセマンティックセグメンテーションの別個処理または後処理アプローチの限界を解消すること。
  • インスタンスセグメンテーションとセマンティックセグメンテーションのタスク間での相互強化を可能にすることで、セグメンテーションの精度を向上させること。
  • 過学習とメモリ消費を低減しながら高い性能を維持する効率的なエンドツーエンドフレームワークを設計すること。
  • 大規模な3DインDoorシーンおよびパーツレベルセグメンテーションデータセットにおける特徴融合と共同学習の有効性を検証すること。

提案手法

  • 生の3次元ポイントクラウドから階層的特徴を抽出するため、共有のPointNet++およびPointConvベースのバックボーンネットワークを採用する。
  • ポイントクラウド特徴融合(PCFF)モジュールがバックボーンからのマルチレベル特徴を統合し、より判別性の高い表現を生成する。
  • 共同インスタンスおよびセマンティックセグメンテーション(JISS)モジュールがセマンティック特徴をインスタンス埋め込み空間に変換し、インスタンス特徴と統合することでインスタンスセグメンテーションの精度を向上させる。
  • JISSモジュールはまた、インスタンス特徴をセマンティック空間に暗黙的に集約することでセマンティックセグメンテーションを強化し、双方向の知識移転を実現する。
  • 学習済みのインスタンス埋め込みに対してマイルドシフトクラスタリングを実行することでインスタンスセグメンテーションを実現し、複雑な後処理を回避する。
  • 全ネットワークはランダムサンプリングと早期停止を用いて訓練され、過学習の低減と一般化性能の向上が図られる。

実験結果

リサーチクエスチョン

  • RQ1別個処理または逐次処理アプローチと比較して、3次元ポイントクラウドにおけるインスタンスセグメンテーションとセマンティックセグメンテーションの共同学習は性能向上に寄与するか?
  • RQ2ネットワークの異なる層間での特徴融合は、3次元ポイントクラウドタスクにおけるセグメンテーション精度にどのように影響するか?
  • RQ3インスタンスセグメンテーションとセマンティックセグメンテーションの間での相互強化は、両タスクの予測精度を向上させることができるか?
  • RQ4過学習を防止するための最適な訓練戦略(例:ランダムサンプリング、早期停止)は何か?
  • RQ5提案されたフレームワークは、インDoorシーンやパーツレベルセグメンテーションを含む多様な3次元データセットにどのように一般化するか?

主な発見

  • JSNetはS3DISデータセットで62.9% mPrecおよび55.0% mIoUを達成し、3次元インスタンスセグメンテーション分野で最先端の手法を上回っている。
  • アブレーションスタディの結果、PCFFモジュールが特徴の判別性を顕著に向上させ、mIoUを52.7%から54.5%に向上させた。
  • インスタンスからセマンティック、セマンティックからインスタンスへのフィードバックを両方備えたJISSモジュールは、単独で使用する場合よりも性能向上が顕著である。
  • 訓練中にランダムサンプリングを適用することで過学習が低減され、一般化性能が向上し、固定サンプリングと比較してmPrecが58.7%から62.9%に向上した。
  • モデルはパーツセグメンテーションのShapeNetでも優れた性能を示しており、インDoorシーンセグメンテーションにとどまらない一般化能力を示している。
  • 早期停止によりさらに一般化性能が向上し、ランダムサンプリングと早期停止を併用した場合に最良の性能(62.9% mPrec、55.0% mIoU)が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。