[論文レビュー] Towards Lightweight Black-Box Attacks against Deep Neural Networks
本稿では、最小限のデータで訓練されたDNNの浅い層を利用することで、1クラスあたり1枚の画像のみを用いて、軽量なブラックボックス攻撃を効果的に実現する手法を紹介する。本手法は、誤差変換器(Error TransFormer, ETF)を提案し、パラメータ空間における近似誤差を特徴空間の摂動に変換することで、完全データのブラックボックス攻撃の97%の攻撃成功率を達成する。
Black-box attacks can generate adversarial examples without accessing the parameters of target model, largely exacerbating the threats of deployed deep neural networks (DNNs). However, previous works state that black-box attacks fail to mislead target models when their training data and outputs are inaccessible. In this work, we argue that black-box attacks can pose practical attacks in this extremely restrictive scenario where only several test samples are available. Specifically, we find that attacking the shallow layers of DNNs trained on a few test samples can generate powerful adversarial examples. As only a few samples are required, we refer to these attacks as lightweight black-box attacks. The main challenge to promoting lightweight attacks is to mitigate the adverse impact caused by the approximation error of shallow layers. As it is hard to mitigate the approximation error with few available samples, we propose Error TransFormer (ETF) for lightweight attacks. Namely, ETF transforms the approximation error in the parameter space into a perturbation in the feature space and alleviates the error by disturbing features. In experiments, lightweight black-box attacks with the proposed ETF achieve surprising results. For example, even if only 1 sample per category available, the attack success rate in lightweight black-box attacks is only about 3% lower than that of the black-box attacks with complete training data.
研究の動機と目的
- 訓練データやモデル出力が利用できない『ノーボックス』設定において、ブラックボックス攻撃が可能かどうかを調査すること。
- 特にDNNの浅い層において、最小限のデータで訓練された代替モデルにおける高い近似誤差の課題に対処すること。
- パラメータ空間の誤差を特徴空間の摂動に変換することで、データ制限の影響を軽減する手法を開発すること。
- 現実世界のシナリオにおいて、軽量ブラックボックス攻撃が完全データブラックボックス攻撃とほぼ同等の性能を達成できることを示すこと。
提案手法
- 少数のサンプルでのみ学習された場合でも安定的で一般化性の高いDNNの浅い層を活用し、軽量な代替モデルを構築する。
- 近似誤差を最悪の特徴空間摂動にマッピングするミニマックスフレームワーク「Error TransFormer(ETF)」を提案する。
- 最悪の特徴空間摂動に対して最大の欺瞞効果を発揮するように、特徴空間最適化スキームを用いて adversarial 例を生成する。
- 教師信号が利用できない場合に、対照的学習と自己教師付き事前学習を用いて、ラベルなしまたは分布外のデータで代替モデルを学習する。
- ETFフレームワークを教師ありおよび教師なし設定、特に分布外(OOD)データに対しても適用し、高い攻撃成功率を維持する。
- モデル近似誤差が誘発する最悪の特徴空間摂動に対して強い、ミニマックス定式化を用いて adversarial 例を生成する。
実験結果
リサーチクエスチョン
- RQ1訓練データやモデル出力が利用できない状況で、1つのテストサンプルしか入手できないノーボックス設定において、ブラックボックス攻撃が有効に機能するか?
- RQ2少数の学習データでも、なぜDNNの浅い層が軽量ブラックボックス攻撃に適しているのか?
- RQ3最小限のデータで学習された代替モデルにおける近似誤差を効果的に軽減する方法は何か? これにより攻撃成功率がどのように向上するか?
- RQ4提案手法であるETFは、教師なしまたは分布外(OOD)データ設定下でも高い攻撃性能を維持できるか?
- RQ51クラスあたり1枚の画像のみを用いる場合、軽量ブラックボックス攻撃は完全データブラックボックス攻撃とどの程度の性能を達成できるか?
主な発見
- 1クラスあたり1枚の画像のみを用いる場合、軽量ブラックボックス攻撃の攻撃成功率は完全データブラックボックス攻撃と3%しか差がない。
- 提案された誤差変換器(ETF)は、最小限のデータで学習された代替モデルにおける近似誤差を、特徴空間の摂動に変換することで効果的に軽減する。
- ETFは教師なし設定下でも強力な性能を発揮し、教師あり情報の有無に関わらず同等の攻撃成功率を達成する。
- 予め分布外データ(例:STL-10)で事前学習されたモデルを用いても効果を発揮し、分布シフトに対して高いロバストネスを示す。
- ImageNetの7種類のモデルを用いた実験により、ノーボックス設定下で、ETFを用いた軽量攻撃が、既存のブラックボックス攻撃手法を著しく上回ることが確認された。
- VGG19、ResNet-152、DenseNet、MobileNetなど多様なアーキテクチャにおいても、最小限のデータ下で攻撃成功率が高く維持される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。