[論文レビュー] TRS: Transferability Reduced Ensemble via Encouraging Gradient Diversity and Model Smoothness
本稿では、基本モデルにおける勾配直交性とモデルスムージングを同時に促進することにより、敵対的転送性を低減する新しいアンサンブル学習手法、TRSを提案する。理論的には、敵対的転送性において勾配類似性とモデルスムージングの両方が重要な要因であると確立し、実験的にも、複数のホワイトボックスおよびブラックボックス攻撃において、MNIST、CIFAR-10、CIFAR-100で最先端のロバスト性を達成し、既存のアンサンブル手法を著しく上回る性能を発揮する。
Adversarial Transferability is an intriguing property - adversarial perturbation crafted against one model is also effective against another model, while these models are from different model families or training processes. To better protect ML systems against adversarial attacks, several questions are raised: what are the sufficient conditions for adversarial transferability and how to bound it? Is there a way to reduce the adversarial transferability in order to improve the robustness of an ensemble ML model? To answer these questions, in this work we first theoretically analyze and outline sufficient conditions for adversarial transferability between models; then propose a practical algorithm to reduce the transferability between base models within an ensemble to improve its robustness. Our theoretical analysis shows that only promoting the orthogonality between gradients of base models is not enough to ensure low transferability; in the meantime, the model smoothness is an important factor to control the transferability. We also provide the lower and upper bounds of adversarial transferability under certain conditions. Inspired by our theoretical analysis, we propose an effective Transferability Reduced Smooth(TRS) ensemble training strategy to train a robust ensemble with low transferability by enforcing both gradient orthogonality and model smoothness between base models. We conduct extensive experiments on TRS and compare with 6 state-of-the-art ensemble baselines against 8 whitebox attacks on different datasets, demonstrating that the proposed TRS outperforms all baselines significantly.
研究の動機と目的
- 深層ニューラルネットワーク間における敵対的転送性の十分条件を理論的に分析すること。
- アンサンブルモデルにおける転送性を低減する実用的な訓練戦略を開発し、ロバスト性を向上させること。
- 勾配直交性とモデルスムージングの間の相互作用が転送性をどのように制御するかを調査すること。
- 勾配多様性とスムージングを同時に強制することでよりロバストなアンサンブルが得られることを実験的に検証すること。
- 特定の幾何的および最適化条件の下で敵対的転送性の上限と下限を示す境界を提供すること。
提案手法
- ベースモデル間の損失勾配のコサイン類似度を最小化する訓練目的関数を提案し、勾配多様性を促進する。
- 敵対的摂動に基づくモデルスムージング正則化項を導入し、局所線形性とロバスト性を強制する。
- 滑らかさ損失の内部最大化を近似するために、投影勾配降下法(PGD)を用い、最悪ケースの勾配方向を推定する。
- 勾配直交性とスムージング項を統合した損失関数を構築し、アンサンブル学習中に同時に最適化する。
- ベースモデルを共有データと補完的正則化で同時に学習する、マルチティーチャーディスティレーションに類似した戦略を採用する。
- TRS訓練手順を、MNIST、CIFAR-10、CIFAR-100における標準アーキテクチャ(例:ResNet-20)に適用する。
実験結果
リサーチクエスチョン
- RQ1深層ニューラルネットワーク間で低敵対的転送性を保証する十分条件は何か?
- RQ2勾配直交性のみで低転送性を達成できるのか、それともモデルスムージングも必要なのか?
- RQ3勾配類似性とモデルスムージングは、敵対的転送性の上限および下限にどのように寄与するか?
- RQ4勾配多様性とモデルスムージングの両方を強制する訓練戦略は、アンサンブルモデルにおける転送性を顕著に低減できるか?
- RQ5提案されたTRS手法は、多様なホワイトボックスおよびブラックボックス攻撃において、最先端のアンサンブルベースラインを上回るロバスト性を達成できるか?
主な発見
- TRSは、MNIST、CIFAR-10、CIFAR-100でSOTAのロバスト精度を達成し、DVERGE、GAL、ADPなどのベースラインをすべての攻撃で上回る。
- ε=0.3のMNISTでは、ILAに対して91.2%のロバスト精度、DI2-FGSMに対して93.7%、IRAに対して84.4%を達成し、DVERGEの89.5%、91.6%、82.0%を上回る。
- ε=0.05のCIFAR-10では、ILAに対して46.2%のロバスト精度、DI2-FGSMに対して50.0%、IRAに対して45.1%を達成し、DVERGEの35.9%、38.3%、32.4%を著しく上回る。
- CIFAR-100では、CW攻撃(c=0.01)に対して45.7%のロバスト精度を達成し、DVERGEの44.8%を上回り、c=0.1では26.9%を達成し、DVERGEの20.3%を上回る。
- アブレーションスタディでは、PGDステップ数(T)を増やすことでロバスト性が向上し、MNISTではT=6がコストと性能のバランスに最適な結果を示す。
- アブレーションでは、TRSの勾配直交性およびスムージング成分の両方がロバスト性に寄与していることが示され、いずれの項を削除しても性能が著しく低下する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。