[論文レビュー] Improving Generalization and Robustness with Noisy Collaboration in Knowledge Distillation.
本稿では、複数のレベルで制御されたノイズを導入することにより、知識蒸留における汎化性能とロバストネスを向上させるために、Fickle Teacher、Soft-Randomization、Messy-Collaborationを提案する。教師の監督を変化させ、学生の入力をランダム化し、汚染されたラベルで訓練することで、精度の低下を最小限に抑えつつ、汎化性能と敵対的ロバストネスが顕著に向上する。
Inspired by trial-to-trial variability in the brain that can result from multiple noise sources, we introduce variability through noise at different levels in a knowledge distillation framework. We introduce Fickle Teacher which provides variable supervision signals to the student for the same input. We observe that the response variability from the teacher results in a significant generalization improvement in the student. We further propose Soft-Randomization as a novel technique for improving robustness to input variability in the student. This minimizes the dissimilarity between the student's distribution on noisy data with teacher's distribution on clean data. We show that soft-randomization, even with low noise intensity, improves the robustness significantly with minimal drop in generalization. Lastly, we propose a new technique, Messy-collaboration, which introduces target variability, whereby student and/or teacher are trained with randomly corrupted labels. We find that supervision from a corrupted teacher improves the adversarial robustness of student significantly while preserving its generalization and natural robustness. Our extensive empirical results verify the effectiveness of adding constructive noise in the knowledge distillation framework for improving the generalization and robustness of the model.
研究の動機と目的
- 制御されたノイズ注入を用いて、知識蒸留におけるモデルの汎化性能とロバストネスを向上させること。
- Fickle Teacherを用いて、静的教師監督の限界を克服し、応答のばらつきを導入すること。
- Soft-Randomizationを用いて、入力の摂動に対するロバストネスを向上させ、学生と教師の分布的乖離を最小限に抑えること。
- ラベルの汚染が学生のロバストネスに与える影響を調査し、訓練戦略としてMessy-Collaborationを提案すること。
- 知識蒸留における建設的なノイズが、自然な汎化性能と敵対的ロバストネスの両方を向上させることを示すこと。
提案手法
- Fickle Teacherは、推論時にノイズを適用することで応答のばらつきを導入し、同じ入力に対して異なる教師出力を得られるようにする。
- Soft-Randomizationは、ノイズが加えられた入力に対する学生の出力と、クリーンな入力に対する教師の出力とのKLダイバージェンスを最小化する。
- Messy-Collaborationは、学生および/または教師をランダムに汚染されたラベルで訓練することで、知識蒸留中にラベルノイズをシミュレートする。
- このフレームワークは、教師出力のばらつき、入力の摂動、ラベルの汚染の3つのレベルにノイズを統合する。
- 動的監督信号を用いた知識蒸留により、学生の汎化性能とロバストネスを向上させる。
- Fickle Teacherでは推論時にノイズが適用され、Soft-RandomizationおよびMessy-Collaborationでは学習中にノイズが適用される。
実験結果
リサーチクエスチョン
- RQ1教師における応答のばらつきを導入することで、知識蒸留における汎化性能が向上するか?
- RQ2Soft-Randomizationは、入力ノイズに対して効果的にロバストネスを向上させるとともに、汎化性能を保持できるか?
- RQ3汚染されたラベルで訓練することで、学生モデルの敵対的ロバストネスが向上するか?
- RQ4複数のノイズ源の組み合わせが、モデルの汎化性能とロバストネスに与える影響は何か?
- RQ5ノイズを知識蒸留に適用する際の、ロバストネスの向上と精度の低下のトレードオフは何か?
主な発見
- Fickle Teacherは、同じ入力に対して異なる監督信号を提供することで、汎化性能を顕著に向上させる。
- Soft-Randomizationは、低ノイズ強度でも、汎化性能の低下を最小限に抑えつつ、入力の変動に対するロバストネスを向上させる。
- Messy-Collaborationは、学生の敵対的ロバストネスを向上させるとともに、自然なロバストネスと汎化性能を保持する。
- 複数のノイズ源の組み合わせは、標準的な蒸留よりも優れた汎化性能とロバストネスをもたらす。
- 知識蒸留における建設的なノイズは、モデルの精度を損なわずに、汎化性能とロバストネスの両方を向上させるのに効果的である。
- 実験的結果は、出力、入力、ラベルの各レベルでのノイズ注入が、モデル性能に相乗効果をもたらすことを確認している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。