Skip to main content
QUICK REVIEW

[論文レビュー] VIN: Voxel-based Implicit Network for Joint 3D Object Detection and Segmentation for Lidars

Yuanxin Zhong, Minghan Zhu|arXiv (Cornell University)|Jul 7, 2021
Remote Sensing and LiDAR Applications参考文献 52被引用数 4
ひとこと要約

本稿では、ボクセルベースの検出器に軽量なセマンティックブランチを追加して暗黙的セマンティック表現を生成することにより、LiDAR点群における統合的3次元物体検出およびセマンティックセグメンテーションフレームワークであるVIN(Voxel-based Implicit Network)を提案する。本手法は、計算コストを最小限に抑えつつnuScenes-lidarsegで最先端の性能を達成し、セマンティックラベルの0.1%のみを用いた弱教師あり学習においても優れた性能を示す。

ABSTRACT

A unified neural network structure is presented for joint 3D object detection and point cloud segmentation in this paper. We leverage rich supervision from both detection and segmentation labels rather than using just one of them. In addition, an extension based on single-stage object detectors is proposed based on the implicit function widely used in 3D scene and object understanding. The extension branch takes the final feature map from the object detection module as input, and produces an implicit function that generates semantic distribution for each point for its corresponding voxel center. We demonstrated the performance of our structure on nuScenes-lidarseg, a large-scale outdoor dataset. Our solution achieves competitive results against state-of-the-art methods in both 3D object detection and point cloud segmentation with little additional computation load compared with object detection solutions. The capability of efficient weakly supervision semantic segmentation of the proposed method is also validated by experiments.

研究の動機と目的

  • LiDAR点群上で3次元物体検出とセマンティックセグメンテーションを同時に実行する統合的ディープラーニングフレームワークの開発。
  • 1段階の3次元検出器から得られる特徴を再利用することで、セマンティックセグメンテーションにかかる計算コストを最小限に抑える。
  • わずかな割合(0.1%)のアノテート済みセマンティックラベルのみを用いて、効果的な弱教師ありセマンティックセグメンテーションを可能にする。
  • 3次元バウンディングボックスの予測とポイントワイドなセマンティックラベルの間の不整合を解消するための新しいトレーニング戦略の導入。
  • 密なセマンティックマップの生成とダウンサンプリングされた点群に対する推論において、暗黙関数の有効性を示すこと。

提案手法

  • バックボーンネットワークの最終特徴マップから暗黙関数を学習するセマンティックブランチを追加することで、1段階の3次元物体検出器を拡張する。
  • 特徴マップをクエリすることで、任意の3次元座標におけるセマンティック分布を予測する暗黙関数を用い、空間上の任意の位置でセマンティック推論を可能にする。
  • バウンディングボックスラベルとスパースなセマンティックアノテーションからの弱教師あり学習により、密度の高いポイントレベルラベルへの依存を低減する。
  • 予測されたセマンティックラベルと3次元バウンディングボックス予測の整合性を高めるために、整合性損失を導入し、検出とセグメンテーション出力の不整合を低減する。
  • 未測定領域に対しても暗黙関数をクエリすることで、ダウンサンプリングされた点群上での効率的な推論を可能にし、セマンティック精度を維持する。
  • 定期的なグリッド上で暗黙関数をクエリすることで、ビューアー視点のセマンティック表現を可能にする、密なセマンティックマップの生成。

実験結果

リサーチクエスチョン

  • RQ1計算コストを最小限に抑えつつ、統合的なネットワークアーキテクチャがLiDAR点群上で3次元物体検出とセマンティックセグメンテーションを効果的に行えるか。
  • RQ2バウンディングボックスラベルと少量のポイントレベルラベルのみを用いて、セマンティックセグメンテーションをどれほど効果的に教師できるか。
  • RQ3共同学習中に、3次元検出ボックスとポイントワイドなセマンティックラベルの不整合をどのように低減できるか。
  • RQ4学習された暗黙関数が、ダウンサンプリングされたり不完全な点群に対しても一般化可能で、セグメンテーション精度を維持できるか。
  • RQ5暗黙関数が、シーン理解やマッピングなどの後続タスクに役立つ、効率的な密なセマンティックマップの生成を可能にするか。

主な発見

  • VINは、3次元物体検出およびセマンティックセグメンテーションの両面で、nuScenes-lidarsegベンチマークで最先端の性能を達成した。
  • セマンティックラベルの0.1%のみを用いても、完全な点群ではmIoUが73.7を達成し、16ビーム(元の点群密度の32%)にダウンサンプリングされた場合でも同様に73.7を維持した。
  • 16ビームのダウンサンプリング入力に対して推論を実行した場合、モデルは70.2 mIoUの高いセグメンテーション精度を維持した。これは、同じ条件下で最近傍探索ベースライン(55.9 mIoU)を上回る結果であった。
  • 推論速度はベースライン検出器とほぼ同等(1台の2080Tiで5.9 FPS 対 6.0 FPS)であり、共同セグメンテーションに伴う追加コストが最小限であることが示された。
  • 入力がダウンサンプリングされた場合でも、LiDAR測定が行われていない領域においても暗黙関数が正確なセマンティック予測を可能とし、スパースな入力に対して高いロバストネスを示した。
  • 暗黙関数のクエリにより生成された密なセマンティックマップは、整合性のあるセマンティック境界を示しており、視覚的解釈や後続タスクに有用であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。