Skip to main content
QUICK REVIEW

[論文レビュー] UniDistill: A Universal Cross-Modality Knowledge Distillation Framework for 3D Object Detection in Bird's-Eye View

Shengchao Zhou, Weizhou Liu|arXiv (Cornell University)|Mar 27, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

UniDistill は、鳥瞰図視点(BEV)における3次元物体検出のためのユニバーサルクロスモダリティ知識蒸留フレームワークを提案する。このフレームワークにより、LiDAR、カメラ、または統合された教師検出器から、単一モダリティの学生検出器への知識転送が可能になる。特徴量を統一されたBEV空間に投影し、3つのスパarsな蒸留損失(特徴、関係、応答)を適用することで、推論のオーバーヘッドを伴わずに学生の性能を向上させ、nuScenesで2.0%〜3.2%のmAPおよびNDS向上を達成した。

ABSTRACT

In the field of 3D object detection for autonomous driving, the sensor portfolio including multi-modality and single-modality is diverse and complex. Since the multi-modal methods have system complexity while the accuracy of single-modal ones is relatively low, how to make a tradeoff between them is difficult. In this work, we propose a universal cross-modality knowledge distillation framework (UniDistill) to improve the performance of single-modality detectors. Specifically, during training, UniDistill projects the features of both the teacher and the student detector into Bird's-Eye-View (BEV), which is a friendly representation for different modalities. Then, three distillation losses are calculated to sparsely align the foreground features, helping the student learn from the teacher without introducing additional cost during inference. Taking advantage of the similar detection paradigm of different detectors in BEV, UniDistill easily supports LiDAR-to-camera, camera-to-LiDAR, fusion-to-LiDAR and fusion-to-camera distillation paths. Furthermore, the three distillation losses can filter the effect of misaligned background information and balance between objects of different sizes, improving the distillation effectiveness. Extensive experiments on nuScenes demonstrate that UniDistill effectively improves the mAP and NDS of student detectors by 2.0%~3.2%.

研究の動機と目的

  • 既存のクロスモダリティ知識蒸留手法が固定された教師-学生モダリティペアに限定されているという課題に対処する。
  • マルチモダリティ検出器のシステム複雑性と、単一モダリティ検出器の性能制限のトレードオフを克服する。
  • LiDARからカメラ、カメラからLiDARD、統合からLiDAR、統合からカメラに至る多様なモダリティ経路におけるユニバーサル蒸留を可能にする。
  • 誤一致した背景特徴をフィルタリングし、オブジェクトサイズの不均衡を補正することで、蒸留効果を向上させる。
  • 推論中に追加の計算を伴わないようにすることで、推論効率を維持しつつ、学生検出器の性能を向上させる。

提案手法

  • 教師および学生検出器の両方の特徴量を統一された鳥瞰図視点(BEV)表現に投影することで、クロスモダリティのアライメントを可能にする。
  • 3つの蒸留損失を適用する:(1) 9つの重要なポイントでの低レベル特徴を一致させる特徴蒸留、(2) 高レベル特徴の関係を一致させる関係蒸留、(3) ガウス型マスクを用いて予測応答を一致させる応答蒸留。
  • 誤って一致しない背景領域からのノイズを低減するために、前景特徴量のみにスパースなアライメントを適用する。
  • 低品質なモダリティ(例:カメラベースの教師からLiDARベースの学生への転送)からの知識転送時に性能の低下を防ぐために、低レベルおよび高レベルのBEV特徴量の後にアダプティブレイヤーを導入する。
  • 異なる検出器間で共通するBEVにおける検出パラダイムを活用することで、多様なモダリティ組み合わせにおける互換性を確保する。
  • 分類スコアマップの各位置で最大値を集める最適化により、応答蒸留を向上させる。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャ的制限なしに、LiDARからカメラ、統合からカメラなどの複数のクロスモダリティ蒸留経路をサポートできるユニバーサル知識蒸留フレームワークを設計できるか?
  • RQ2誤って一致した背景特徴をフィルタリングしつつ、効果的に知識を転送するための蒸留損失はどのように設計できるか?
  • RQ3特に小さなオブジェクトにおいて、オブジェクトサイズの不均衡を補正することで、蒸留に与える影響は何か?
  • RQ4低品質なモダリティ(例:カメラ)から高品質なモダリティ(例:LiDAR)への転送において、アダプティブレイヤーはどのように蒸留性能を向上させるか?
  • RQ5全特徴量蒸留と比較して、スパースな前景特徴量のみの蒸留は、効率性および正確性をどの程度向上させるか?

主な発見

  • UniDistill は、nuScenesデータセットにおける全テスト蒸留経路で、学生検出器のmAPおよびNDSを2.0%〜3.2%向上させた。
  • 統合からカメラへの経路では、UniDistill がベースライン比で3.2%のmAP向上および3.2%のNDS向上を達成した。
  • ガウス型マスクを用いた応答蒸留損失が最も高い性能を示し、経路(4)においてベースライン比でmAPを4.3%向上させた。
  • アブレーションスタディにより、アダプティブレイヤーが不可欠であることが確認された。それらを削除すると検出損失が増加し、特にカメラベースの教師からLiDARベースの学生への転送時において性能が著しく低下した。
  • 重要なポイントに基づく関係蒸留は、均等なサンプリングを上回る性能を示し、経路(4)においてベースライン比でmAPを1.9%向上させた。
  • スコアマップの各位置で最大値を集める戦略により、応答蒸留が向上し、経路(4)においてベースライン比でNDSが3.2ポイント向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。