[論文レビュー] Boosting Adversarial Transferability by Block Shuffle and Rotation
本稿では、ランダムなブロックシャッフルと回転によって画像構造を破壊することで、モデル間で一貫した注視マップを実現する、Adversarial Transferability を向上させる新しい入力変換手法 Block Shuffle and Rotation (BSR) を提案する。BSR は ImageNet において最先端の転送性を達成し、特に adversarially trained および defended モデルに対して、攻撃成功確率が最大 6.0% 向上する。
Adversarial examples mislead deep neural networks with imperceptible perturbations and have brought significant threats to deep learning. An important aspect is their transferability, which refers to their ability to deceive other models, thus enabling attacks in the black-box setting. Though various methods have been proposed to boost transferability, the performance still falls short compared with white-box attacks. In this work, we observe that existing input transformation based attacks, one of the mainstream transfer-based attacks, result in different attention heatmaps on various models, which might limit the transferability. We also find that breaking the intrinsic relation of the image can disrupt the attention heatmap of the original image. Based on this finding, we propose a novel input transformation based attack called block shuffle and rotation (BSR). Specifically, BSR splits the input image into several blocks, then randomly shuffles and rotates these blocks to construct a set of new images for gradient calculation. Empirical evaluations on the ImageNet dataset demonstrate that BSR could achieve significantly better transferability than the existing input transformation based methods under single-model and ensemble-model settings. Combining BSR with the current input transformation method can further improve the transferability, which significantly outperforms the state-of-the-art methods. Code is available at https://github.com/Trustworthy-AI-Group/BSR
研究の動機と目的
- ブラックボックス攻撃における adversarial examples の転送性が低い問題、特にモデル間で注視マップの不一致に起因する問題を解決すること。
- 画像の内在的な空間的構造を破壊することで、注視マップの安定化と転送性の向上が可能かどうかを調査すること。
- 複数の変換済み画像上で adversarial パーティクルを最適化することで、注視マップの分散を低減する新しい入力変換ベースの攻撃を構築すること。
- BSR の有効性を、認証済み防御およびノイズ除去防御を含む強力な防御に対して評価し、耐性と現実世界における脅威の潜在的影響を示すこと。
提案手法
- BSR は入力画像を重複のない固定数のブロックに分割し、空間的整合性を破壊する。
- 各ブロックは事前に定義された範囲内でランダムな角度でシャッフルおよび回転され、複数の変換済み画像が生成される。
- 訓練の安定化と分散の低減を図るため、N 個のこのような変換済み画像における平均勾配を用いて adversarial パーティクルを最適化する。
- ソースモデル上の注視マップを破壊するため、ランダムな変換(シャッフルおよび回転)を適用するが、意味的コンテンツは保持される。
- BSR は既存の転送ベース攻撃と互換性があり、TI-DIM や SIM などの手法と組み合わせることでさらに性能を向上できる。
- ブロック数(n)、変換画像数(N)、回転角度範囲(τ)は、破壊度と最適化安定性のバランスを図るためにアブレーションにより調整されたハイパーパrameterである。

実験結果
リサーチクエスチョン
- RQ1ブロックシャッフルと回転による画像の内在的空間的構造の破壊は、異なるモデル間でより一貫した注視マップをもたらすか?
- RQ2異なる注視マップを持つ複数の変換済み画像上で adversarial パーティクルを最適化することで、標準的な入力変換手法に比べて転送性が向上するか?
- RQ3ブロック数、変換画像数、回転角度範囲といったハイパーパrameter が BSR の性能に与える影響は何か?
- RQ4Adversarial training や認証防御を含む強力な防御に対しても、BSR は高い転送性を維持できるか?
- RQ5単一モデルおよびアンサンブル設定の両方において、BSR は最先端の転送ベース攻撃と比較して攻撃成功確率で優れているか?
主な発見
- BSR は adversarially trained モデルに対して ImageNet で平均 98.4% の攻撃成功確率を達成し、Admix-TI-DIM よりも少なくとも 6.0% 高い。
- スケール不変手法(SIM)と組み合わせた BSR-SI-TI-DIM は、平均 94.1% の攻撃成功確率を達成し、Admix-TI-DIM よりも 5.0% 高い。
- 認証防御 RS および強力なノイズ除去器 NRP に対して、それぞれ 83.9% および 84.2% の成功確率を示し、Admix-TI-DIM よりも 11.3% および 3.8% 高い。
- アブレーションスタディの結果、n=2 ブロック、N=20 変換画像、τ=24° 回転範囲が、破壊度と最適化安定性のバランスを最適に保つ。
- ブロックシャッフル(BS)およびブロック回転(BR)は MI-FGSM よりも転送性を向上させるが、両者を組み合わせた BSR が最も高い性能を示し、相乗効果を確認した。
- 本手法はモデル間での注視マップの分散を顕著に低減し、一貫した注視パターンが転送性を向上させるという仮説を裏付けた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。