[論文レビュー] Defending against Adversarial Attack towards Deep Neural Networks via Collaborative Multi-task Training
本稿では、敵対的訓練とラベルペア符号化を組み合わせることで、ブラックボックスおよびグレイボックス攻撃に対して耐性を持つ協調的マルチタスク訓練防御を提案する。CIFAR-10で悪意のある正確性が2.1%低下するのみで、ブラックボックスの敵対的例では96.3%の正確性を達成し、高信頼度の敵対的入力を98.7%検出する。
Deep neural networks (DNNs) are known to be vulnerable to adversarial examples which contain human-imperceptible perturbations. A series of defending methods, either proactive defence or reactive defence, have been proposed in the recent years. However, most of the methods can only handle specific attacks. For example, proactive defending methods are invalid against grey-box or white-box attacks, while reactive defending methods are challenged by low-distortion adversarial examples or transferring adversarial examples. This becomes a critical problem since a defender usually does not have the type of the attack as a priori knowledge. Moreover, existing two-pronged defences (e.g., MagNet), which take advantages of both proactive and reactive methods, have been reported as broken under transferring attacks. To address this problem, this paper proposed a novel defensive framework based on collaborative multi-task training, aiming at providing defence for different types of attacks. The proposed defence first encodes training labels into label pairs and counters black-box attacks leveraging adversarial training supervised by the encoded label pairs. The defence further constructs a detector to identify and reject high-confidence adversarial examples that bypass the black-box defence. In addition, the proposed collaborative architecture can prevent adversaries from finding valid adversarial examples when the defence strategy is exposed. In the experiments, we evaluated our defence against four state-of-the-art attacks on $MNIST$ and $CIFAR10$ datasets. The results showed that our defending method achieved up to $96.3\%$ classification accuracy on black-box adversarial examples, and detected up to $98.7\%$ of the high confidence adversarial examples. It only decreased the model accuracy on benign example classification by $2.1\%$ for the $CIFAR10$ dataset.
研究の動機と目的
- 攻撃タイプが事前に不明な状況でも効果を発揮する汎用的防御の欠如に応えること。
- 転送攻撃や高信頼度の敵対的例に対して失敗する既存の能動的・受動的防御の限界を克服すること。
- 攻撃者がモデルや防御戦略の部分的知識(グレイボックス)を持つ状況でも効果を発揮する防御を構築すること。
- 敵対的摂動に対して著しく強化された耐性を発揮しつつ、クリーン(良性)例における高い正確性を維持すること。
- 防御機構が暴露された場合でも、モデルの逆転や敵対的例生成に対して耐性を持つ防御を構築すること。
提案手法
- 敵対的訓練中に分類ラベルをラベルペアに符号化することで、ブラックボックス攻撃に対する耐性を向上させる。
- 主分類ヘッドと敵対的例検出器を共同で最適化する協調的マルチタスク学習を用いる。
- 主な防御を回避する高信頼度の敵対的例を特定・拒否するように検出器を訓練する。
- ラベルペア符号化を活用して、モデルの意思決定境界を正則化し、微小な入力摂動への感受性を低減する。
- 勾配ベースの敵対的訓練とラベルペア符号化を統合することで、転送可能な攻撃下での一般化性能を向上させる。
- アーキテクチャ設計による勾配情報のマスキングにより、グレイボックス環境下でも勾配ベース攻撃に対して耐性を持つように防御を設計する。
実験結果
リサーチクエスチョン
- RQ1攻撃タイプが事前に不明な状況でも、ブラックボックスおよびグレイボックス攻撃に対して効果的に耐性を持つ防御機構を設計可能か?
- RQ2ブラックボックス環境下で、低信頼度の敵対的例に対するモデルの耐性向上にラベルペア符号化はどの程度有効か?
- RQ3マルチタスク検出器は、主分類器を回避する高信頼度の敵対的例をどの程度効果的に検出できるか?
- RQ4攻撃者に防御戦略が暴露された場合、その効果性が損なわれるか、かつその状況下でも防御が耐性を持つことができるか?
- RQ5MNIST や CIFAR-10 などの標準ベンチマークにおいて、良性正確性とスケーラビリティの観点から、この防御はどの程度の性能を示すか?
主な発見
- 提案された防御は、ブラックボックスの敵対的例に対して96.3%の分類正確性を達成し、多くの既存防御を著しく上回った。
- 敵対的例検出器は、高信頼度の敵対的例の98.7%を効果的に特定し、優れた検出能力を示した。
- CIFAR-10データセットにおいて、良性例の正確性が最小限2.1%低下するのみで、実用的妥当性が明確に示された。
- 転送攻撃に対しても効果的であり、勾配マスキングとラベルペア正則化のおかげでグレイボックス攻撃に対しても耐性を示した。
- 以前に代替攻撃で破壊された既存の二段階防御(例:MagNet)を上回る性能を示した。
- 防御の性能は、非標的敵対的例の質に依存するため、クラスマップの品質に敏感であり、訓練に使用された例の耐性と多様性に依存する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。