[論文レビュー] Pre-trained Adversarial Perturbations
本論文は、微調整前の事前学習済みビジョンモデルを標的にする、新たなユニバーサル adversarial 攻撃手法である Pre-trained Adversarial Perturbations (PAPs) を提案する。低レベル層の活性化を操作する Low-Level Layer Lifting Attack (L4A) を活用し、一様なガウスノイズの増幅によって転移性を向上させることで、10の下流タスクにおいて微調整済みモデルに対する攻撃成功率が最大95.3%にまで向上し、準ブラックボックス設定下で最先端の手法を上回る。
Self-supervised pre-training has drawn increasing attention in recent years due to its superior performance on numerous downstream tasks after fine-tuning. However, it is well-known that deep learning models lack the robustness to adversarial examples, which can also invoke security issues to pre-trained models, despite being less explored. In this paper, we delve into the robustness of pre-trained models by introducing Pre-trained Adversarial Perturbations (PAPs), which are universal perturbations crafted for the pre-trained models to maintain the effectiveness when attacking fine-tuned ones without any knowledge of the downstream tasks. To this end, we propose a Low-Level Layer Lifting Attack (L4A) method to generate effective PAPs by lifting the neuron activations of low-level layers of the pre-trained models. Equipped with an enhanced noise augmentation strategy, L4A is effective at generating more transferable PAPs against fine-tuned models. Extensive experiments on typical pre-trained vision models and ten downstream tasks demonstrate that our method improves the attack success rate by a large margin compared with state-of-the-art methods.
研究の動機と目的
- 事前学習モデルが微調整後に残存する adversarial 攻撃の脆弱性を調査すること。
- 事前学習から微調整へのパイプラインにおける adversarial 穩健性の評価ギャップを埋めること。
- 下流タスクの詳細が不明な準ブラックボックス設定で有効なユニバーサル adversarial 攻撃手法を開発すること。
- 低レベル特徴表現に注目することで、adversarial perturbations の微調整間での転送性を向上させること。
提案手法
- 事前学習モデルの初期層におけるニューロン活性化を標的にする Low-Level Layer Lifting Attack (L4A) を提案する。
- 微調整中に低レベル層が比較的変更されにくいため、攻撃の有効性が保持されることに着目する。
- 一様なガウスサンプリングを用いたノイズ増幅戦略を導入し、PAPs の転送性を向上させる。
- 誤分類を最大化すると同時に低レベル特徴への変更を最小化するように、摂動を最適化する。
- 摂動生成をガイドするため、低レベル層の活性化を重視する損失関数を採用する。
- モデル間で一貫性と一般化を保つために、すべてのモデルで同一のハイパーパramータ設定(μl=0.4, μh=0.6, σl=0.05, σh=0.1)を用いる。
実験結果
リサーチクエスチョン
- RQ1事前学習モデル向けに作成された adversarial perturbations は、微調整後の下流モデルに対しても高い転送性を維持できるか?
- RQ2なぜ事前学習モデルの低レベル層が、事前学習から微調整へのパイプラインにおけるユニバーサル adversarial 攻撃の優れた標的となるのか?
- RQ3ノイズ増幅は、ユニバーサル adversarial perturbations の微調整間転送性をどのように向上させるのか?
- RQ4ハイレベル層の損失を含めることで、この文脈におけるユニバーサル adversarial 攻撃手法の性能はどの程度劣化するのか?
- RQ5提案手法の L4A は、多様な下流タスクにおいて、既存のユニバーサル攻撃ベースラインと比較してどの程度の攻撃成功率を達成するのか?
主な発見
- ベースL4A設定を用いる場合、ResNet101では平均71.90%、ResNet50では72.64%、ViT-Base-16では94.42%の攻撃成功率を達成した。
- ノイズ増幅(L4A ugs)を適用すると、ResNet101で72.20%、ResNet50で77.80%、ViT-Base-16で95.30%に上昇し、顕著な改善が確認された。
- 3つの事前学習モデルおよび10の下流タスクにおいて、EPGD、UAP、ASVを含むすべてのベースラインを上回った。
- ε=0.05 のピクセルレベル摂動では平均12.52%の攻撃成功率にとどまり、標準的な摂動ではこの文脈では効果が薄いことが示された。
- ハイレベル層の損失を含めると、攻撃成功率が10%以上低下し、低レベル特徴に注目することが重要であることを確認した。
- ハイパーパramータ設定(μl=0.4, μh=0.6, σl=0.05, σh=0.1)は、再チューニングなしにモデル間で良好に一般化され、一貫した性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。