Skip to main content
QUICK REVIEW

[論文レビュー] LTD: Low Temperature Distillation for Gradient Masking-free Adversarial Training

Erh–Chung Chen, Che–Rung Lee|arXiv (Cornell University)|Nov 3, 2021
Adversarial Robustness in Machine Learning参考文献 55被引用数 11
ひとこと要約

本稿では、勾配マスキングを回避するために低温度の教師モデルからのソフトラベルを用いる知識蒸留ベースの手法であるLow Temperature Distillation (LTD) を提案する。LTDは追加データを用いずにCIFAR-10で58.19%のロバスト精度、ImageNetで42.08%のロバスト精度を達成し、滑らかなクラス間確率分布を活用することで、先行手法を上回る性能を発揮する。

ABSTRACT

Adversarial training is a widely adopted strategy to bolster the robustness of neural network models against adversarial attacks. This paper revisits the fundamental assumptions underlying image classification and suggests that representing data as one-hot labels is a key factor that leads to vulnerabilities. However, in real-world datasets, data ambiguity often arises, with samples exhibiting characteristics of multiple classes, rendering one-hot label representations imprecise. To address this, we introduce a novel approach, Low-Temperature Distillation (LTD), designed to refine label representations. Unlike previous approaches, LTD incorporates a relatively low temperature in the teacher model, while maintaining a fixed temperature for the student model during both training and inference. This strategy not only refines assumptions about data distribution but also strengthens model robustness and avoids the gradient masking problem commonly encountered in defensive distillation. Experimental results demonstrate the efficacy of the proposed method when combined with existing frameworks, achieving robust accuracy rates of 58.19%, 31.13%, and 42.08% on the CIFAR-10, CIFAR-100, and ImageNet datasets, respectively, without the need for additional data.

研究の動機と目的

  • 深層ニューラルネットワークにおける自然な精度とロバスト精度のギャップを是正すること。
  • 特に曖昧な画像に対してモデルのロバストネスを損なう要因としてのone-hotラベル表現を特定すること。
  • 勾配マスキングを回避しつつ、クラス間関係を捉えるソフトラベルベースの学習手法を提案すること。
  • 教師モデルと生徒モデルの温度を別々に設定した修正された蒸留フレームワークを用いて、アドバーシャルロバストネスを向上させること。
  • 追加のラベルなしの不確実なデータに依存せず、CIFAR-10、CIFAR-100、ImageNetで最先端のロバスト精度を達成すること。

提案手法

  • LTDは、教師モデルを低温度で訓練してソフトラベルを生成する知識蒸留フレームワークを用いる。
  • 生徒モデルは、教師モデルから得たソフトラベルと交差エントロピー損失を用いて学習され、教師とは異なる、より高い温度を用いる。
  • 防御的蒸留の温度ベースの勾配スムージングに依存しないため、勾配マスキングを回避する。
  • ソフトラベルは、良好に訓練された教師モデルから生成され、クラス間の関係性と意味的距離を捉える。
  • さらにロバストネスを向上させるために、AWPなどのアドバーシャルトレーニング手法と組み合わせる。
  • フレームワークは、CIFAR-10、CIFAR-100、ImageNetの各データセットにおいて、Wide ResNetおよびResNet-50アーキテクチャで評価される。

実験結果

リサーチクエスチョン

  • RQ1one-hotラベルをソフトラベルに置き換えることで、深層ニューラルネットワークにおけるアドバーシャルロバストネスが向上するか?
  • RQ2教師モデルで低温度を用いることで、ロバストな一般化に寄与するソフトラベルの品質が向上するか?
  • RQ3教師モデルと生徒モデルで異なる温度を設定することで、勾配マスキングを回避しつつロバストネスを向上させられるか?
  • RQ4追加データなしの状況において、LTDは既存のアドバーシャルトレーニング手法と比較してロバスト精度で優れているか?
  • RQ5LTDは、AWPのような他のロバストトレーニング手法と効果的に組み合わせられ、性能をさらに向上させられるか?

主な発見

  • LTDは、追加データなしでWRN-34-10を用いてCIFAR-10で55.09%のロバスト精度を達成し、ベースラインのアドバーシャルトレーニングを上回る。
  • AWPと組み合わせた場合、LTDはCIFAR-10で58.19%のロバスト精度に達し、追加データなしの手法において新たな最先端を記録する。
  • CIFAR-100では、LTDが31.13%のロバスト精度を達成し、データフリー手法の中でほぼ最高の結果となる。
  • ImageNetでは、LTDを適用することで、同じアーキテクチャで4%程度のロバスト精度向上が見られた。
  • 低温度の教師モデルからのソフトラベルの使用により、オラクル分布とモデル予測との乖離が顕著に減少した。
  • アドバーシャルトレーニングで学習されたモデルは自然精度が低いため、教師として不適切であり、ソフトラベル生成には自然に訓練されたモデルが好ましい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。