[論文レビュー] How and When Adversarial Robustness Transfers in Knowledge Distillation?
本稿では、標準的なKDが保持できない敵対的ロバストネスを教師から生徒モデルに転送するため、KDIGA(入力勾配整合を伴う知識蒸留)を提案する。学習中に生徒および教師ネットワークの入力勾配を整合させることで、KDIGAは生徒が教師と同等以上の認証ロバストネスを達成することを保証する。CIFAR-10では最大17.81%、ImageNetでは最大37.5%の実験的ロバストネス向上を達成し、クリーンな精度を維持または向上させる。
Knowledge distillation (KD) has been widely used in teacher-student training, with applications to model compression in resource-constrained deep learning. Current works mainly focus on preserving the accuracy of the teacher model. However, other important model properties, such as adversarial robustness, can be lost during distillation. This paper studies how and when the adversarial robustness can be transferred from a teacher model to a student model in KD. We show that standard KD training fails to preserve adversarial robustness, and we propose KD with input gradient alignment (KDIGA) for remedy. Under certain assumptions, we prove that the student model using our proposed KDIGA can achieve at least the same certified robustness as the teacher model. Our experiments of KD contain a diverse set of teacher and student models with varying network architectures and sizes evaluated on ImageNet and CIFAR-10 datasets, including residual neural networks (ResNets) and vision transformers (ViTs). Our comprehensive analysis shows several novel insights that (1) With KDIGA, students can preserve or even exceed the adversarial robustness of the teacher model, even when their models have fundamentally different architectures; (2) KDIGA enables robustness to transfer to pre-trained students, such as KD from an adversarially trained ResNet to a pre-trained ViT, without loss of clean accuracy; and (3) Our derived local linearity bounds for characterizing adversarial robustness in KD are consistent with the empirical results.
研究の動機と目的
- 標準的な知識蒸留がなぜ生徒モデルにおける敵対的ロバストネスを保持できないのかを調査すること。
- 教師から生徒モデルへの敵対的ロバストネスの転送を可能にする手法を開発すること、特に異なるアーキテクチャ間でも可能であることを目的とする。
- やや厳しい仮定のもとで、KDIGAで訓練された生徒モデルが教師と同等以上の認証ロバストネスを達成することを理論的に証明すること。
- 知識蒸留における局所的線形性の役割が、敵対的ロバストネス転送にどのように寄与するかを分析すること。
- ResNets やビジョントランスフォーマーを含む多様なモデルに対して、ImageNet および CIFAR-10 で本手法を検証すること。
提案手法
- 学習中に生徒と教師モデルの入力勾配の差のL2ノルムを最小化する知識蒸留フレームワーク、KDIGAを導入する。
- 標準的なKD損失に勾配整合正則化項を追加し、生徒が教師の入力勾配方向を模倣するよう促進する。
- 局所的線形性指標(LLM)、交差エントロピー損失、勾配整合ノルムに基づいて認証ロバストネスの理論的境界を導出する。
- 敵対的訓練済みResNetから、MobileNetV2 や事前学習済みViTといった小型モデルへの蒸留に本手法を適用する。
- KDIGAを敵対的訓練(ARD)と組み合わせることで、より低い理論的境界とより優れた実験的性能を達成する。
- CIFAR-10 および ImageNet におけるロバストネスを評価するために、変動する摂動半径を持つPGD攻撃を用いる。
実験結果
リサーチクエスチョン
- RQ1なぜ標準的な知識蒸留が教師から生徒モデルへの敵対的ロバストネスを保持できないのか?
- RQ2知識蒸留において、どのような条件下で教師から生徒モデルへの敵対的ロバストネスが成功裏に転送可能か?
- RQ3例えばResNetsとビジョントランスフォーマーのような根本的に異なるアーキテクチャ間でも、敵対的ロバストネスを転送可能か?
- RQ4KDIGAにおける入力勾配整合は、生徒モデルの局所的線形性およびロバストネスをどのように向上させるか?
- RQ5KDIGAは、クリーン精度を損なうことなく、事前学習済みの生徒モデルにも適用可能か?
主な発見
- 敵対的訓練済みのWideResNetから蒸留されたMobileNetV2の生徒モデルについて、CIFAR-10におけるロバストネスは5.97%から17.81%に向上し、標準KDよりも高いクリーン精度を達成した。
- ImageNetでは、KDIGAにより生徒のロバストネスが標準KDの1.5%から37.5%に向上し、ベースライン手法を著しく上回った。
- KDIGAにより、敵対的訓練済みResNetから事前学習済みビジョントランスフォーマー(ViT)へのロバストネス転送が可能となり、ViTのロバストネスが11.1倍に向上したが、クリーン精度は損なわれなかった。
- KDIGAで蒸留された生徒モデルは、アーキテクチャが異なる場合(例:ResNetからMobileNetV2)でも、教師と同等またはそれ以上のロバストネスを達成した。
- 局所的線形性指標に基づく理論的境界は、実験的ロバストネスの傾向とよく一致しており、KDIGAおよびARDは標準KDよりも低い境界を達成した。
- KDIGAと敵対的蒸留(ARD)を組み合わせることで、理論的ロバストネス境界がさらに低下し、CIFAR-10におけるε=4/255のとき、最低境界1.081を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。