[論文レビュー] RangeViT: Towards Vision Transformers for 3D Semantic Segmentation in Autonomous Driving
RangeViT は、範囲投影を用いた LiDAR ポイントクラウドの 3D スマートセグメンテーションのためのビジョントランスフォーマー(ViT)ベースの手法を提案する。ImageNet で事前学習された ViT を活用し、畳み込みスタムと軽量な畳み込みデコーダーを用いて性能を向上させた。nuScenes および SemanticKITTI において、2D 投影ベースの手法の中で最先端の結果を達成し、自然画像で事前学習された ViT が、構造的変更を最小限に抑えながらも、疎でノイズの多い LiDAR データへ効果的に転移可能であることを示した。
Casting semantic segmentation of outdoor LiDAR point clouds as a 2D problem, e.g., via range projection, is an effective and popular approach. These projection-based methods usually benefit from fast computations and, when combined with techniques which use other point cloud representations, achieve state-of-the-art results. Today, projection-based methods leverage 2D CNNs but recent advances in computer vision show that vision transformers (ViTs) have achieved state-of-the-art results in many image-based benchmarks. In this work, we question if projection-based methods for 3D semantic segmentation can benefit from these latest improvements on ViTs. We answer positively but only after combining them with three key ingredients: (a) ViTs are notoriously hard to train and require a lot of training data to learn powerful representations. By preserving the same backbone architecture as for RGB images, we can exploit the knowledge from long training on large image collections that are much cheaper to acquire and annotate than point clouds. We reach our best results with pre-trained ViTs on large image datasets. (b) We compensate ViTs' lack of inductive bias by substituting a tailored convolutional stem for the classical linear embedding layer. (c) We refine pixel-wise predictions with a convolutional decoder and a skip connection from the convolutional stem to combine low-level but fine-grained features of the the convolutional stem with the high-level but coarse predictions of the ViT encoder. With these ingredients, we show that our method, called RangeViT, outperforms existing projection-based methods on nuScenes and SemanticKITTI. The code is available at https://github.com/valeoai/rangevit.
研究の動機と目的
- ビジョントランスフォーマー(ViT)が、LiDAR ポイントクラウドの 2D 投影ベースの 3D スマートセグメンテーションを改善できるかどうかを調査すること。
- ViT に内挿的バイアスが欠如していることや、小規模データセットでの性能が低い問題に対処するため、入力処理の適応とハイブリッドエンコーダ-デコーダー構造の導入を行うこと。
- 自然画像と範囲投影との間のドメインギャップがあるにもかかわらず、ImageNet で事前学習された ViT が LiDAR データへ転送可能かどうかを評価すること。
- 2D 画像と 3D ポイントクラウドのタスクの両方でネットワークアーキテクチャを統一し、モダリティを跨いで ViT バックボーンを再利用すること。
- 疎な LiDAR データを用いた ViT ベースの 3D セグメンテーションの今後の研究のための、単純だが効果的なベースラインを確立すること。
提案手法
- 3D LiDAR ポイントクラウドを範囲投影により 2D ビルズアイビュー特徴マップに変換する。
- 標準的な ViT と同様のパッチベースのトークン化戦略を用いて、投影された 2D マップから視覚的トークンを抽出する。
- ImageNet-21k の事前学習から初期化された重みを用いて、事前学習済みのビジョントランスフォーマー エンコーダー(例:ViT-S)を用いて高レベル表現を抽出する。
- 標準的な線形埋め込み層の代わりに、畳み込みスタムを導入することで、インダクティブバイアスを注入し、疎な範囲投影における特徴学習を向上させる。
- 畳み込みスタムからのスキップ接続を備えた軽量な畳み込みデコーダーを用いて、粗い ViT の予測を、低レベルの空間的詳細を統合することで精緻化する。
- ピクセル単位の予測をアップサンプリングし、最終的なス emitting ラベルのための 3D 空間に再投影する。
実験結果
リサーチクエスチョン
- RQ1大規模な自然画像データセットで事前学習されたビジョントランスフォーマーが、ドメインギャップがあるにもかかわらず、3D LiDAR スマートセグメンテーションの微調整に効果的に適用可能か?
- RQ2ViT の標準的な線形埋め込み層を畳み込みスタムに置き換えることで、疎でノイズの多い LiDAR 範囲投影における性能が向上するか?
- RQ3スタムからのスキップ接続を備えた軽量な畳み込みデコーダーが、3D セグメンテーションにおける ViT ベースの予測品質を向上させられるか?
- RQ4標準的な自動走行ベンチマークにおいて、ViT ベースのモデルは畳み込みニューラルネットワーク(CNN)ベースの投影手法と比較してどの程度の性能を示すか?
- RQ5この低データ環境下で、事前学習済み ViT は、ランダム初期化または非事前学習済み ViT よりも顕著に優れた性能を示すか?
主な発見
- RangeViT は、nuScenes のバリデーションセットで 74.77% の平均交差率(mIoU)を達成し、過去のあらゆる 2D 投影ベースの手法を上回った。
- SemanticKITTI のテストセットでは、mIoU が 70.6% に達し、2D 投影ベースの手法の中で第1位となり、Cylinder3D などのボクセルベースのモデルとの差を縮めつつあった。
- アブレーションスタディの結果、同じ微調整プロトコル下で、ImageNet-21k で事前学習された ViT-S バックボーンを用いることで、ResNet-50 バックボーンに比べて mIoU が 14.3% 高くなった。
- アイデンティティバックボーン(特徴抽出なし)を用いたアブレーションでは、mIoU が僅か 53.73% にとどまり、ViT 特徴が単純な線形投影よりも転移学習に適していることが確認された。
- 事前学習済み ViT、畳み込みスタム、スキップ接続付きデコーダーの組み合わせにより、特に歩行者や自転車などレアクラスや低密度クラスにおいて顕著な性能向上が得られた。
- 定性的な結果から、RangeViT は境界アーチファクトを低減し、複雑な構造のセグメンテーションを改善したが、走行可能な表面と歩道との間には依然として誤認識が残っていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。