[論文レビュー] Learning Efficient Detector with Semi-supervised Adaptive Distillation
本稿では、教師ネットワークからのソフトラベルを用いて、単一段階オブジェクト検出器における学習が難しいサンプルおよび模倣が難しいサンプルを適応的に重み付けする、半教師付きの適応的蒸留(SAD)という知識蒸留手法を提案する。困難なサンプルに注目して蒸留損失を強化し、ソフトターゲットを用いた未ラベルデータを活用することで、SADはResNet-50の学生モデルがCOCOでResNet-101の教師を上回ることを可能にし、90msの推論時間で36.9 mAPを達成した—これは先行モデルよりも高速かつ高精度である。
Knowledge Distillation (KD) has been used in image classification for model compression. However, rare studies apply this technology on single-stage object detectors. Focal loss shows that the accumulated errors of easily-classified samples dominate the overall loss in the training process. This problem is also encountered when applying KD in the detection task. For KD, the teacher-defined hard samples are far more important than any others. We propose ADL to address this issue by adaptively mimicking the teacher's logits, with more attention paid on two types of hard samples: hard-to-learn samples predicted by teacher with low certainty and hard-to-mimic samples with a large gap between the teacher's and the student's prediction. ADL enlarges the distillation loss for hard-to-learn and hard-to-mimic samples and reduces distillation loss for the dominant easy samples, enabling distillation to work on the single-stage detector first time, even if the student and the teacher are identical. Besides, ADL is effective in both the supervised setting and the semi-supervised setting, even when the labeled data and unlabeled data are from different distributions. For distillation on unlabeled data, ADL achieves better performance than existing data distillation which simply utilizes hard targets, making the student detector surpass its teacher. On the COCO database, semi-supervised adaptive distillation (SAD) makes a student detector with a backbone of ResNet-50 surpasses its teacher with a backbone of ResNet-101, while the student has half of the teacher's computation complexity. The code is avaiable at https://github.com/Tangshitao/Semi-supervised-Adaptive-Distillation
研究の動機と目的
- 知識蒸留の効率性が低い、単一段階検出器において、容易なサンプルが損失に支配され、困難なサンプルが十分に重視されない問題に対処すること。
- 学生と教師のネットワークが同一である場合や、ラベル付きおよび未ラベル付きデータが異なる分布に属する場合でも、効果的な知識蒸留を可能にすること。
- 未ラベルデータに対して教師からのソフトラベルを用いることで、半教師付きオブジェクト検出を改善すること。
- 予測の不確実性(学習が難しい)と予測ギャップ(模倣が難しい)の両方を考慮して蒸留重みを適応的に調整する手法を開発すること。
提案手法
- 予測の不確実性が高く(学習が難しい)、教師の予測と学生の予測のギャップが大きい(模倣が難しい)サンプルの2種類の困難なサンプルに基づき、動的に蒸留重みを調整する適応的蒸留損失(ADL)を提案する。
- ADLは、学習が難しいおよび模倣が難しいサンプルの損失を増加させるとともに、容易なサンプルの損失を低減することで、後者による訓練目的への支配を防ぐ。
- ADLを教師付きおよび半教師付きの両設定に適用し、未ラベルデータに対して教師から得たソフトラベルを用いて学生の学習をガイドする。
- 教師が少なくとも1つのオブジェクトを検出する(ポジティブな反応を示す)画像を優先する、未ラベルデータの選択戦略を導入することで、蒸留の効率を向上させる。
- 未ラベルデータの監督信号として、教師モデルのソフトターゲット(ログティス)を用い、学生が容易に予測可能なハードターゲットによる非効率を回避する。
- 学生をラベル付きデータ(真値)と未ラベル付きデータ(ソフトターゲット)の両方でADLを用いて訓練する統一された訓練スキームを採用する。
実験結果
リサーチクエスチョン
- RQ1適応的蒸留は、容易なサンプルが損失に支配される単一段階検出器における知識蒸留を改善できるか?
- RQ2未ラベルデータに対して教師からのソフトラベルを用いることで、学生と教師が同一である場合やデータ分布が異なる場合でも、学生の性能向上が達成できるか?
- RQ3予測の不確実性と予測ギャップに基づく適応的損失重み付けにより、標準的な蒸留と比較してより良い一般化性能が得られるか?
- RQ4ラベル付きおよび未ラベル付きデータの組み合わせを用いて適応的蒸留で学習させた学生モデルが、教師の性能を上回ることができるか?
- RQ5ラベル付きおよび未ラベル付きデータが異なる分布に属する場合、提案された未ラベルデータ選択手法はどの程度効果的か?
主な発見
- SADを用いて訓練されたResNet-50の学生検出器は、COCOでResNet-101の教師を上回り、90msの推論時間で36.9 mAPを達成した—これはRetinaNet-50-800よりも高速かつ高精度である。
- 教師がResNext-101である場合、学生モデルは36.6 mAPを達成し、計算複雑度が半分であるにもかかわらず、教師を上回った。
- 学生と教師が同一である場合でも、ADLは困難なサンプルに注目することで性能を向上させ、モデル容量の差を超えた有効性を示した。
- ImageNet(COCOとは異なる分布)の未ラベルデータを用いた半教師付き設定でも、性能向上を維持した。特に、教師がオブジェクトを検出する(ポジティブな反応を示す)画像を選択することで、その効果が顕著に現れた。
- 正の反応を示す画像の割合が低い場合(例:ρ ≤ 0.2)に、提案された未ラベルデータ選択手法が蒸留性能を向上させ、現実のデータ不足状況を反映した。
- SADを用いることで、学生検出器はわずか90msの推論時間で36.9 mAPを達成し、精度と速度の両面でFPN-FRCNおよびRetinaNet-101-800を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。