Skip to main content
QUICK REVIEW

[論文レビュー] MASS: Multi-Attentional Semantic Segmentation of LiDAR Data for Dense Top-View Understanding

Kunyu Peng, Juncong Fei|arXiv (Cornell University)|Jul 1, 2021
Advanced Neural Network Applications被引用数 4
ひとこと要約

MASSは、ピラー特徴量と3つのアテンション機構——キーポイント駆動型グラフアテンション、LSTMベースの空間アテンション、ピラー基準アテンション——を活用して、LiDARデータの密度の高いトップビュー意味セグメンテーションを実現するマルチアテンション型ディープラーニングフレームワークを提案する。SemanticKITTIでは58.80%のmIoU、nuScenes-LidarSegでは30.4%を達成し、自動運転アプリケーションにおける優れた汎化性能とニアリアルタイム推論を示している。

ABSTRACT

At the heart of all automated driving systems is the ability to sense the surroundings, e.g., through semantic segmentation of LiDAR sequences, which experienced a remarkable progress due to the release of large datasets such as SemanticKITTI and nuScenes-LidarSeg. While most previous works focus on sparse segmentation of the LiDAR input, dense output masks provide self-driving cars with almost complete environment information. In this paper, we introduce MASS - a Multi-Attentional Semantic Segmentation model specifically built for dense top-view understanding of the driving scenes. Our framework operates on pillar- and occupancy features and comprises three attention-based building blocks: (1) a keypoint-driven graph attention, (2) an LSTM-based attention computed from a vector embedding of the spatial input, and (3) a pillar-based attention, resulting in a dense 360-degree segmentation mask. With extensive experiments on both, SemanticKITTI and nuScenes-LidarSeg, we quantitatively demonstrate the effectiveness of our model, outperforming the state of the art by 19.0% on SemanticKITTI and reaching 30.4% in mIoU on nuScenes-LidarSeg, where MASS is the first work addressing the dense segmentation task. Furthermore, our multi-attention model is shown to be very effective for 3D object detection validated on the KITTI-3D dataset, showcasing its high generalizability to other tasks related to 3D vision.

研究の動機と目的

  • スパースなLiDARポイントクラウドからの密度の高いトップビュー意味セグメンテーションの挑戦に応えること。これは、スパースなポイントワイズセグメンテーションよりも豊かな環境理解を可能にする。
  • 不規則でスパースな3次元ポイントクラウドにおいて2次元CNNの限界を克服するため、アテンション機構を組み込んだピラー基準のエンドツーエンドフレームワークを設計すること。
  • マルチスケールのデータ拡張とアテンションベースの特徴量集約を通じて、実世界のドライブシナリオにおける汎化性能とロバストネスを向上させること。
  • アブレーションとクロスデータセット評価を通じて、3次元ビジョンタスク(例:3次元オブジェクト検出)へのモデルの転送可能性を実証すること。

提案手法

  • フレームワークは、スパースな3次元LiDARポイントクラウドを効率的な2次元CNN処理を可能にする密度の高い2次元ピラー特徴量に変換するピラー特徴量ネットワーク(PFN)を用いる。
  • ピラー特徴量を処理するための修正版UNet(M-UNet)バックボーンが、密度の高いトップビューのセグメンテーションマスクを生成する。
  • 3つのアテンション機構を統合する:(1) 局所的コンテキストモデリングのためのキーポイント駆動型グラフアテンション、(2) 空間ベクトル埋め込みからのLSTMベースのアテンションによる順序依存性学習、(3) 全体的な特徴量の最適化のためのピラー基準アテンション。
  • グリッドセル単位のラベルに基づく交差エントロピー損失を用いて、可視領域は占有マップによって制限されたまま、エンドツーエンドでモデルを訓練する。
  • ロバストネス向上のため、ランダムフリップ、回転、スケーリングといったデータ拡張技術を適用するが、性能劣化のため、トランスレーションは除外する。
  • 推論はリアルタイムデプロイメントを最適化しており、GTX 2080Tiで1フレームあたり74msの速度を達成し、MAはわずか約16msのオーバーヘッドにとどまる。

実験結果

リサーチクエスチョン

  • RQ1既存のスパースまたは2次元セグメンテーション手法と比較して、マルチアテンション機構はスパースLiDARデータにおける密度の高いトップビュー意味セグメンテーション性能を向上させることができるか?
  • RQ2提案された3つのアテンションモジュール——キーポイント駆動型グラフ、LSTMベースの空間、ピラー基準アテンション——は、3次元シーン理解のための局所的およびグローバルコンテキストをどれほど効果的に捉えられるか?
  • RQ3提案されたMASSフレームワークは、意味セグメンテーションを越えて、3次元オブジェクト検出のような他の3次元ビジョンタスクに対しても良好に汎化するか?
  • RQ4ランダムフリップ、回転、スケーリングといったデータ拡張戦略は、実世界のドライブシナリオにおけるモデルの汎化性能とロバストネスをどの程度向上させるか?

主な発見

  • MASSはSemanticKITTIデータセットで58.80%のmIoUを達成し、SOTAをmIoUで19.0%上回った。
  • nuScenes-LidarSegベンチマークでは、30.4%のmIoUを達成し、このデータセットにおける密度の高いトップビューセグメンテーションを処理する最初の手法としてSOTAを樹立した。
  • アブレーションスタディにより、ランダムフリップと回転がmIoUを4.6%向上させ、スケーリングが0.6%向上させることを確認した。これは、拡張による顕著な向上を示している。
  • GTX 2080Tiで1フレームあたり74msのニアリアルタイム推論を達成し、リアルタイム自動運転アプリケーションに適している。
  • マルチアテンション機構により特徴表現が向上し、アブレーションスタディおよび下流の3次元オブジェクト検出タスクにおいて一貫した性能向上が確認された。
  • KITTI-3Dデータセットでの評価により、3次元オブジェクト検出への汎化性能が裏付けられ、3次元ビジョンタスク間での強い転送可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。