[論文レビュー] Improving Adversarial Transferability with Gradient Refining
本稿では、入力多様性変換中に生じる負の勾配を是正することで、敵対的転送性を向上させる手法である勾配精錬(Gradient Refining)を提案する。複数の変換済み入力からの勾配を統合・精錬することで、最先端手法を平均6.0%上回る82.07%の転送成功率を達成し、単一モデル設定下でImageNetで高い性能を発揮する。
Deep neural networks are vulnerable to adversarial examples, which are crafted by adding human-imperceptible perturbations to original images. Most existing adversarial attack methods achieve nearly 100% attack success rates under the white-box setting, but only achieve relatively low attack success rates under the black-box setting. To improve the transferability of adversarial examples for the black-box setting, several methods have been proposed, e.g., input diversity, translation-invariant attack, and momentum-based attack. In this paper, we propose a method named Gradient Refining, which can further improve the adversarial transferability by correcting useless gradients introduced by input diversity through multiple transformations. Our method is generally applicable to many gradient-based attack methods combined with input diversity. Extensive experiments are conducted on the ImageNet dataset and our method can achieve an average transfer success rate of 82.07% for three different models under single-model setting, which outperforms the other state-of-the-art methods by a large margin of 6.0% averagely. And we have applied the proposed method to the competition CVPR 2021 Unrestricted Adversarial Attacks on ImageNet organized by Alibaba and won the second place in attack success rates among 1558 teams.
研究の動機と目的
- 白ボックス攻撃の転送性が低くなる原因となる、ソースモデルへの過剰適合を解消すること。
- 入力多様性におけるランダム変換が、役に立たないまたは逆効果となる勾配信号をもたらす影響を軽減すること。
- アーキテクチャの変更なしに、多様なモデル間で堅牢で転送性の高い敵対的例を改善すること。
- 既存の勾配ベース攻撃フレームワーク(例:FGSM、PGD、モーメンタムベース攻撃)と互換性があり、スケーラブルでプラグイン可能な手法を開発すること。
提案手法
- 同一の入力画像に複数のランダムで微分可能な変換を適用し、多様な入力パターンを生成する。
- ソースモデルを用いて各変換済み入力の勾配を計算し、正の勾配信号と負の勾配信号の両方を捉える。
- すべての変換済み入力からの勾配を統合し、負の勾配成分を抑制する精錬メカニズムを適用する。
- 重み付き平均化や方向補正プロセスを通じて、正の信号を組み合わせ、負の信号を相殺することで最終的な勾配を精錬する。
- 精錬された勾配を標準的な反復的攻撃アルゴリズム(例:FGSM、PGD)に統合し、より転送性の高い摂動を生成する。
- 性能と計算コストの最適化を図るため、補正回数パラメータ(n)を用いて変換数と勾配精錬の回数を制御する。
実験結果
リサーチクエスチョン
- RQ1敵対的攻撃生成時における入力多様性のランダム変換がもたらす負の影響を、勾配精錬が効果的に軽減できるか。
- RQ2ベースライン手法と比較して、勾配精錬はどの程度異なるモデル間での転送性を向上させるか。
- RQ3モーメンタムや平行移動不変性を持つ攻撃と組み合わせた場合、勾配精錬の統合が全体の攻撃成功確率にどのような影響を与えるか。
- RQ4転送性を向上させる一方で、敵対的例の知覚的品質(例:LPIPS)は維持または向上するか。
- RQ5アーキテクチャの変更なしに、さまざまな攻撃フレームワークに一般化可能か。
主な発見
- 提案手法R-DTMI-FGSMは、単一モデル設定下で3つのモデルに対して平均82.07%の転送成功率を達成し、ベースラインのDTMI-FGSMを5.93ポイント上回った。
- CVPR 2021のImageNet向け非制限的敵対的攻撃コンテストにおいて、1,558チームの参加の中、攻撃成功率で2位を獲得した。
- アブレーションスタディの結果、補正回数を1から11に増やすことで転送成功率が向上し、11回を超えると飽和が観察された。
- 可視化結果から、本手法で生成された敵対的摂動は、高い転送性を維持しながらも、より目立たない(LPIPSが低い)特性を示した。
- DI-FGSM、DTI-FGSM、DTMI-FGSMなど、複数の攻撃ベースラインに対して一貫して転送成功率が向上し、平均で6.0%の向上を達成した。
- アンサンブルモデル設定下でも、精錬手法(R-DTMI-FGSM)は高い性能を維持し、モデルの多様性に対して頑健であり、一般化性能が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。