Skip to main content
QUICK REVIEW

[論文レビュー] Toward Adversarial Robustness via Semi-supervised Robust Training

Yiming Li, Baoyuan Wu|arXiv (Cornell University)|Mar 16, 2020
Adversarial Robustness in Machine Learning参考文献 50被引用数 5
ひとこと要約

本稿では、標準リスクとロバストリスクを同時に最小化することで敵対的ロバストネスを向上させる、新たな防御手法である半教師付きロバストトレーニング(SRT)を提案する。リスクを分離し、ラベルに依存しないロバストリスクを用いて未ラベルデータを活用することで、ピクセル単位の摂動および空間的摂動の両方に対して最先端の性能を達成し、ラベル付きデータが少ない場合でさえ教師あり手法を上回る。

ABSTRACT

Adversarial examples have been shown to be the severe threat to deep neural networks (DNNs). One of the most effective adversarial defense methods is adversarial training (AT) through minimizing the adversarial risk $R_{adv}$, which encourages both the benign example $x$ and its adversarially perturbed neighborhoods within the $\ell_{p}$-ball to be predicted as the ground-truth label. In this work, we propose a novel defense method, the robust training (RT), by jointly minimizing two separated risks ($R_{stand}$ and $R_{rob}$), which is with respect to the benign example and its neighborhoods respectively. The motivation is to explicitly and jointly enhance the accuracy and the adversarial robustness. We prove that $R_{adv}$ is upper-bounded by $R_{stand} + R_{rob}$, which implies that RT has similar effect as AT. Intuitively, minimizing the standard risk enforces the benign example to be correctly predicted, and the robust risk minimization encourages the predictions of the neighbor examples to be consistent with the prediction of the benign example. Besides, since $R_{rob}$ is independent of the ground-truth label, RT is naturally extended to the semi-supervised mode ($i.e.$, SRT), to further enhance the adversarial robustness. Moreover, we extend the $\ell_{p}$-bounded neighborhood to a general case, which covers different types of perturbations, such as the pixel-wise ($i.e.$, $x + δ$) or the spatial perturbation ($i.e.$, $ AX + b$). Extensive experiments on benchmark datasets not only verify the superiority of the proposed SRT method to state-of-the-art methods for defensing pixel-wise or spatial perturbations separately, but also demonstrate its robustness to both perturbations simultaneously. The code for reproducing main results is available at \url{https://github.com/THUYimingLi/Semi-supervised_Robust_Training}.

研究の動機と目的

  • 深層ニューラルネットワークの敵対的例に対する脆弱性、特に多様な摂動タイプに対して対処すること。
  • ラベル付きデータを活用することで、教師あり敵対的トレーニングを越えた敵対的ロバストネスの向上を図ること。
  • ピクセル単位の摂動および空間変換を含む、複数の摂動タイプに一般化可能な統一された防御フレームワークの開発。
  • 敵対的リスクの上界を理論的に導出し、連合リスク最小化の有効性を正当化すること。
  • ロバストネスがラベル付きデータだけでなく未ラベルデータの活用によっても向上できることを示し、効率的な半教師付き学習を可能にすること。

提案手法

  • 本手法は、標準リスク $ R_{\text{stand}} $ とロバストリスク $ R_{\text{rob}} $ を同時に最小化する新しいロバストトレーニング(RT)目的関数を導入する。ここで、$ R_{\text{rob}} $ は正常な入力とその摂動近傍との間の予測の一貫性を測定する。
  • ロバストリスク $ R_{\text{rob}} $ は、すべての摂動近傍における最大の0/1損失として定義され、真のラベルを必要としないため、半教師付き拡張が可能である。
  • 本稿では、敵対的リスク $ R_{\text{adv}} $ が $ R_{\text{stand}} + R_{\text{rob}} $ で上界されると証明されており、RTが敵対的トレーニングと同等のロバストネスを達成できることを保証する。
  • メトリックに基づく近傍定義を用いて、$ \ell_p $-有界近傍を越えて、空間的および関数的摂動を含む広範な変換クラスに一般化する。
  • 半教師付きロバストトレーニング(SRT)は、未ラベルデータを $ R_{\text{rob}} $ に統合することで、これらのサンプルにラベルが不要なまま、ロバストネスを顕著に向上させる。
  • 複合攻撃に対処するため、複数の摂動タイプを同時に考慮する一般化された近傍定義を適用することで、フレームワークを拡張する。

実験結果

リサーチクエスチョン

  • RQ1標準リスクとロバストリスクの連合最小化は、標準的な敵対的トレーニングよりも、敵対的ロバストネスの向上により効果的か?
  • RQ2真のラベルに依存しないロバストリスクは、半教師付き設定で効果的に活用可能であり、モデルの一般化性能の向上に寄与するか?
  • RQ3$ \ell_p $-有界ピクセル単位の摂動を超えた摂動近傍の一般化は、空間的変換などの多様な攻撃タイプに対抗する防御を可能にするか?
  • RQ4SRTで訓練された1つのモデルが、同時にピクセル単位の摂動および空間的摂動に対してロバストであるか?
  • RQ5未ラベルデータの使用は、ロバストトレーニングにおける標準的精度と敵対的ロバストネスのトレードオフにどのように影響するか?

主な発見

  • SRTは、MNISTデータセットで10,000件のラベル付きデータと50,000件の未ラベルデータを用いて訓練したが、60,000件すべてのラベル付きデータを用いて訓練したWorst-of-kよりも、空間的攻撃に対して高い敵対的精度を達成した。
  • SRTの敵対的精度は、未ラベルデータをより多く使用するにつれて向上を続けるため、より大きなデータプールでさらなる向上が期待できる。
  • 可視化結果から、SRTはより平坦な意思決定表面と高い信頼度の平坦帯を生成しており、微小摂動に対してロバストである理由が説明できる。
  • SRTは、ピクセル単位の摂動および空間的摂動の両方に対して、最先端の手法を上回る性能を示し、連合的ロバストネスを実現した。
  • 本手法はピクセル単位および空間的摂動を越えて一般化可能であり、ぼかしや色の変更などの他の変換に対しても応用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。