[論文レビュー] Learning Lightweight Object Detectors via Multi-Teacher Progressive Distillation
本稿では、畳み込み型からTransformerベースのものまで多様な事前学習済み物体検出器から段階的に知識を転送する、メタレベルの戦略であるMulti-Teacher Progressive Distillation (MTPD) を提案する。中間の教師からより強力な教師へ段階的に蒸留することで、アーキテクチャ的・容量的ギャップを埋め、MS COCO で最先端の精度を達成した:ResNet-50 RetinaNet は 36.5% から 42.0% AP に、Mask R-CNN は 38.2% から 42.5% AP に向上した。
Resource-constrained perception systems such as edge computing and vision-for-robotics require vision models to be both accurate and lightweight in computation and memory usage. While knowledge distillation is a proven strategy to enhance the performance of lightweight classification models, its application to structured outputs like object detection and instance segmentation remains a complicated task, due to the variability in outputs and complex internal network modules involved in the distillation process. In this paper, we propose a simple yet surprisingly effective sequential approach to knowledge distillation that progressively transfers the knowledge of a set of teacher detectors to a given lightweight student. To distill knowledge from a highly accurate but complex teacher model, we construct a sequence of teachers to help the student gradually adapt. Our progressive strategy can be easily combined with existing detection distillation mechanisms to consistently maximize student performance in various settings. To the best of our knowledge, we are the first to successfully distill knowledge from Transformer-based teacher detectors to convolution-based students, and unprecedentedly boost the performance of ResNet-50 based RetinaNet from 36.5% to 42.0% AP and Mask R-CNN from 38.2% to 42.5% AP on the MS COCO benchmark.
研究の動機と目的
- 複雑で可変長の出力と教師・学生モデル間のアーキテクチャ的差異が性能を制限する物体検出における知識蒸留の課題に対処すること。
- 特に、Transformerベースのバックボーンから畳み込み型バックボーンへの転送において顕著な容量ギャップを克服すること。
- 試行錯誤に依存せずに、学生の性能を最大化するための、教師モデルの選定と順序付けを体系的かつ自動化する手法を開発すること。
- Swin Transformerベースの検出器からResNet-50ベースの学生への、異種アーキテクチャ間での効果的な蒸留を実現すること — これは従来の手法が達成できなかった。
- 段階的学習によって学生がより平坦な最小値に収束するように誘導することで、蒸留モデルの一般化性能を向上させること。
提案手法
- 教師検出器の順序付きカーソン・シーケンスを用いて、学生モデルを段階的に訓練するプログレッシブな蒸留パイプラインを設計する。初期段階では性能は低いが互換性の高い教師から始め、徐々に強力で複雑な教師へと移行する。
- 蒸留メカニズムに関する事前知識が不要な、モデル間の表現類似度に基づくヒューリスティックなアルゴリズムを導入し、最適な教師シーケンスを自動的に特定する。
- 中間特徴マップの一致を実現するため、ハイパーパrameter λ を用いた特徴マッチング損失を採用。λ は経験的に調整され、RetinaNet では 0.5、Mask R-CNN では 0.8 に設定された。
- 既存の蒸留手法(例:MGD, FGD, CWD)と統合する際は、学生の初期化時に最初の教師のネックおよびヘッドパラメータを一度だけ継承する戦略を適用する。
- Swin Transformerベースの教師と、ResNetベースの学生の間で、階層的特徴マップが一致するように活用し、追加の特徴マップ一致関数を必要とせずに直接的な蒸留を可能にする。
- すべてのモデルを MMDetection を用いて標準設定で訓練する:8 GPU、12エポック、COCO では入力解像度 1333×800、Argoverse-HD では 1920×1200、SGD とモーメンタム 0.9 を使用する。

実験結果
リサーチクエスチョン
- RQ1複数の教師からの段階的蒸留は、単一教師蒸留を上回る性能を、軽量な物体検出器にもたらすか?
- RQ2より互換性の高い中間モデルから始まり、最終的により強力な教師に移行する順序的蒸留は、異種アーキテクチャ間の容量ギャップを埋めるか?
- RQ3アーキテクチャ的差異があるにもかかわらず、Swin Transformer ベースの検出器から畳み込み型の学生(例:ResNet-50)への知識転送は効果的に行えるか?
- RQ4MTPD は、損失関数の地形が平坦になることで示されるように、学生モデルの一般化性能を向上させるか?
- RQ5蒸留メカニズムに関する事前知識がなくても、提案されたヒューリスティックな教師シーケンス選定法は、手動またはランダム順序よりも優れた性能を発揮するか?
主な発見
- MTPD は MS COCO で最先端の性能を達成し、ResNet-50 RetinaNet は 36.5% から 42.0% AP に、Mask R-CNN は 38.2% から 42.5% AP に向上した。
- 中間教師(ResNet-101)からの段階的蒸留に続いて最終教師(ResNeXt-101)を用いることで 41.4% AP を達成し、最終教師からの直接蒸留(41.0%)や中間教師のみの使用(40.7%)を上回った。
- 本手法は、従来の手法がアーキテクチャ的不適合性により達成できなかった、Transformerベースの教師(Swin Transformer)から畳み込み型学生への前例のない知識転送を可能にした。
- 学生の性能向上は最適化の向上によるものではなく、一般化性能の向上によるものであり、損失関数の地形におけるより平坦な最小値への収束が裏付けとして示された。
- 事前知識が不要なヒューリスティックベースの教師シーケンス選定アルゴリズムは、蒸留メカニズムの詳細を知らない状態でも、最適な学習順序を効果的に特定し、多様な設定で一貫して性能向上をもたらした。
- MTPD は既存の蒸留技術(例:MGD, FGD, CWD)と互換性があり、使用される損失関数の複雑さに関わらず、一貫して性能を向上させた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。