Skip to main content
QUICK REVIEW

[論文レビュー] CrossKD: Cross-Head Knowledge Distillation for Object Detection

Jiabao Wang, Yumin Chen|arXiv (Cornell University)|Jun 20, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

CrossKDは、学生の検出ヘッドから教師のヘッドへの中間特徴の転送により、教師の予測と正例ラベルの間の矛盾を軽減する、オブジェクト検出のための新規な知識蒸留フレームワークを提案する。このクロスヘッド蒸留により、YOLOv5ベースのGFL-R50はCOCOで43.7 APに向上し、これまでのあらゆるKD手法を上回る性能を達成する。

ABSTRACT

Knowledge Distillation (KD) has been validated as an effective model compression technique for learning compact object detectors. Existing state-of-the-art KD methods for object detection are mostly based on feature imitation. In this paper, we present a general and effective prediction mimicking distillation scheme, called CrossKD, which delivers the intermediate features of the student's detection head to the teacher's detection head. The resulting cross-head predictions are then forced to mimic the teacher's predictions. This manner relieves the student's head from receiving contradictory supervision signals from the annotations and the teacher's predictions, greatly improving the student's detection performance. Moreover, as mimicking the teacher's predictions is the target of KD, CrossKD offers more task-oriented information in contrast with feature imitation. On MS COCO, with only prediction mimicking losses applied, our CrossKD boosts the average precision of GFL ResNet-50 with 1x training schedule from 40.2 to 43.7, outperforming all existing KD methods. In addition, our method also works well when distilling detectors with heterogeneous backbones. Code is available at https://github.com/jbwang1997/CrossKD.

研究の動機と目的

  • 知識蒸留における予測模倣と特徴模倣の間の性能ギャップを是正すること。
  • 正例ラベルと教師の予測がしばしば食い違うため、予測模倣における矛盾する監督信号を解消すること。
  • 学生と教師のネットワークの最適化目的を一致させることで、蒸留の効率を向上させること。
  • 複雑な特徴模倣に依存せずに、予測模倣損失のみを用いて最先端の性能を達成すること。

提案手法

  • CrossKDは、学生の検出ヘッドから得た中間特徴を教師のヘッドに転送し、クロスヘッド予測を生成する。
  • 蒸留損失は、学生と教師の直接的な比較ではなく、クロスヘッド予測と元の教師の予測の間で適用される。
  • この設計により、KD損失が学生の元の検出ヘッドから分離され、最適化中に矛盾する勾配を回避できる。
  • タスク固有の損失関数を用いる:回帰にはGIoU、分類にはシグモイド変調を施した修正版QFL。
  • 共有されたネットワーク部品のおかげで、クロスヘッド予測は教師の出力とより一貫性を持つようになり、トレーニングの安定性が向上する。
  • この手法は特徴模倣とは直交しており、PKDなどの手法と組み合わせることでさらなる向上が可能である。

実験結果

リサーチクエスチョン

  • RQ1なぜオブジェクト検出のKDにおいて予測模倣は特徴模倣に比べて性能が低いのか?
  • RQ2予測模倣における正例ターゲットと蒸留ターゲットの間の性能ギャップの原因は何か?
  • RQ3KD損失を学生の検出ヘッドから分離させることで、トレーニングの安定性と性能が向上するか?
  • RQ4学生の特徴を教師のヘッドに転送することで、標準的なKDよりも一貫性のある監督が得られるか?
  • RQ5単純な予測模倣のみの手法が、最先端の特徴模倣ベースのKD手法を上回ることができるか?

主な発見

  • CrossKDは、GFL-R50を用いて予測模倣損失のみでCOCOで43.7 APを達成し、ベースラインから3.5 APの向上を実現した。
  • 本手法は、特徴模倣に基づく手法を含め、あらゆる既存のKD手法を上回る性能を発揮した。
  • PKDと組み合わせた場合、CrossKDは43.9 APを達成し、特徴模倣手法との直交性と補完性を示した。
  • アブレーションスタディの結果、QFL損失は正例領域と負例領域の両方に適用した場合、BCEに比べて2.5 APの優位性を示した。
  • 可視化結果から、教師の予測が最適でない場合でも、CrossKDは教師よりも優れた検出結果を生成することが確認された。
  • 本手法はトレーニング収束を高速化し、矛盾する監督信号によるトレーニング不安定性を回避できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。