Skip to main content
QUICK REVIEW

[論文レビュー] Review: deep learning on 3D point clouds

Saifullahi Aminu Bello, Shangshu Yu|arXiv (Cornell University)|Jan 17, 2020
3D Shape Modeling and Analysis参考文献 102被引用数 4
ひとこと要約

この論文は、グリッドベースの前処理の制限を克服するため、非構造的で不規則な3次元点群からの直接学習に注目した、3次元点群処理の最先端のディープラーニング手法をレビューしている。PointNetおよびその変種のようなアーキテクチャを調査し、サンプリング、グループ化、MLPを用いた特徴学習によって局所構造を捉える。分類、セグメンテーション、検出ベンチマーク(例:ModelNet40 や KITTI)で優れた性能を達成している。

ABSTRACT

Point cloud is point sets defined in 3D metric space. Point cloud has become one of the most significant data format for 3D representation. Its gaining increased popularity as a result of increased availability of acquisition devices, such as LiDAR, as well as increased application in areas such as robotics, autonomous driving, augmented and virtual reality. Deep learning is now the most powerful tool for data processing in computer vision, becoming the most preferred technique for tasks such as classification, segmentation, and detection. While deep learning techniques are mainly applied to data with a structured grid, point cloud, on the other hand, is unstructured. The unstructuredness of point clouds makes use of deep learning for its processing directly very challenging. Earlier approaches overcome this challenge by preprocessing the point cloud into a structured grid format at the cost of increased computational cost or lost of depth information. Recently, however, many state-of-the-arts deep learning techniques that directly operate on point cloud are being developed. This paper contains a survey of the recent state-of-the-art deep learning techniques that mainly focused on point cloud data. We first briefly discussed the major challenges faced when using deep learning directly on point cloud, we also briefly discussed earlier approaches which overcome the challenges by preprocessing the point cloud into a structured grid. We then give the review of the various state-of-the-art deep learning approaches that directly process point cloud in its unstructured form. We introduced the popular 3D point cloud benchmark datasets. And we also further discussed the application of deep learning in popular 3D vision tasks including classification, segmentation and detection.

研究の動機と目的

  • 非構造的で不規則的かつ順序のない3次元点群にディープラーニングを直接適用する際の課題に対処すること。
  • 点群を構造的なグリッドに変換する初期のアプローチを調査し、計算コストの高さと情報損失といったその主な制限を強調すること。
  • 点群をその元の形のまま直接処理する最近の最先端のディープラーニング手法について、詳細なレビューを提供すること。
  • 主要な3次元ビジョンタスクにおける性能を評価するための、3次元点群ベンチマークデータセットを提示すること。
  • インスタンスセグメンテーションや大規模シーン処理といった、3次元点群学習における未解決の研究課題を特定すること。

提案手法

  • 点群におけるディープラーニングの課題を、不規則性、非構造的性質、順序のない点集合という観点から分類すること。
  • 点群をボクセルグリッドやビアズアイビューに変換することでCNNの利用を可能にする、前処理に基づく手法をレビューすること。
  • 特にPointNetおよびその拡張形が、最大プーリングなどの順序不変演算を用いることで、直接的な点群処理手法を分析すること。
  • 局所特徴抽出のコアパイプラインを説明する:重心の選択のためのサンプリング、K-NNによる近隣点のグループ化、MLPやPointNetに類似したモジュールによる局所表現の学習。
  • 局所パッチ内の点同士の関係をモデル化するアーキテクチャ的イノベーションを強調し、特徴の識別性を向上させること。
  • モダリティ(LiDAR、RGB-D、マルチモーダル)、速度、およびModelNet40 や KITTI といった標準ベンチマークでの性能に基づいて、手法を比較すること。

実験結果

リサーチクエスチョン

  • RQ1非構造的で不規則な3次元点群にディープラーニングを直接適用する際の主な課題は何か?
  • RQ2前処理に基づく手法はこれらの課題をどのように克服しているのか? その主な制限は何であるか?
  • RQ3点群に直接ディープラーニングを適用可能にするための核心的なアーキテクチャ的原則は何か? また、それらは局所的・全体的な構造をどのように保持しているか?
  • RQ4最近の手法は、PointNetに比べてどのように局所幾何的関係をよりよく捉えているか?
  • RQ5インスタンスセグメンテーションや大規模シーン理解といった3次元点群タスクにおける現在の性能限界と未解決の課題は何か?

主な発見

  • PointNetおよびその変種は、3次元点群分類とセグメンテーションで優れた性能を発揮しており、PointNet++は階層的サンプリングとグループ化により局所特徴学習を向上させている。
  • ModelNet40ベンチマークにおいて、PointNetはXYZ座標のみを用いて分類精度89.2%を達成しており、順序不変学習の有効性を示している。
  • KITTIデータセットにおける3次元物体検出では、PointPillarsが3次元検出ベンチマークでmAP 59.2%、ビアズアイビューベンチマークでmAP 56.0%を達成し、推論速度は62 Hzであった。
  • PointRCNN や VoxelNet といった手法は、KITTI 3次元検出ベンチマークでmAP 80%を超えるスコアを達成しており、点群からの物体検出における高い正確性を示している。
  • 進展は見られるものの、インスタンスセグメンテーションや点群からの直接的な3次元検出は依然として未開拓であり、[120, 121] のような大規模シーン処理に取り組む少数の研究にとどまっている。
  • LiDARと画像のマルチモーダル入力を用いることで検出性能が向上し、AVOD-FPN はKITTI 3次元ベンチマークでmAP 55.62%を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。