Skip to main content
QUICK REVIEW

[論文レビュー] Online Adversarial Purification based on Self-Supervision

Changhao Shi, Chester Holtz|arXiv (Cornell University)|Jan 23, 2021
Adversarial Robustness in Machine Learning参考文献 33被引用数 12
ひとこと要約

本稿では、再訓練を必要とせず、自己教師あり表現学習を活用してテスト時における敵対的例を浄化する、自己教師ありオンライン敵対的浄化(SOAP)を提案する。訓練中に分類とラベルに依存しない自己教師ありタスクを同時に最適化することで、推論時に勾配ベースの反復的浄化が可能となり、最小限の訓練コストで強力な敵対的攻撃に対しても高い耐性を示す。敵対的攻撃者が防御戦略を把握している場合でも、依然として高い耐性を示す。

ABSTRACT

Deep neural networks are known to be vulnerable to adversarial examples, where a perturbation in the input space leads to an amplified shift in the latent network representation. In this paper, we combine canonical supervised learning with self-supervised representation learning, and present Self-supervised Online Adversarial Purification (SOAP), a novel defense strategy that uses a self-supervised loss to purify adversarial examples at test-time. Our approach leverages the label-independent nature of self-supervised signals and counters the adversarial perturbation with respect to the self-supervised tasks. SOAP yields competitive robust accuracy against state-of-the-art adversarial training and purification methods, with considerably less training complexity. In addition, our approach is robust even when adversaries are given knowledge of the purification defense strategy. To the best of our knowledge, our paper is the first that generalizes the idea of using self-supervised signals to perform online test-time purification.

研究の動機と目的

  • 人間が感知できない摂動によって入力を誤分類する可能性がある深層ニューラルネットワークの脆弱性を是正すること。
  • 敵対的訓練の計算負荷を軽減し、耐性をテスト時における浄化に移行させること。
  • ラベルに依存しない自己教師あり信号が、敵対的摂動の検出および逆転に有効であるかを検証すること。
  • 敵対的攻撃者が浄化メカニズムを把握している場合でも有効な防御を設計すること。
  • 画像固有のオートエンコーダーやGANに依存しない、汎用的な自己教師あり事前学習タスクを用いて敵対的浄化を一般化すること。

提案手法

  • 標準的な訓練中に、分類ヘッドと補助的な自己教師ありタスク(例:回転予測、対照的学習、再構成)を同時に学習する深層ニューラルネットワークを訓練する。
  • テスト時、分類器の入力を固定したまま、自己教師あり損失を最小化するための反復的投影勾配降下法(PGD)を適用し、入力をクリーンなデータ多様体へと浄化する。
  • 分類と浄化の両方のタスクに同じエンコーダーを共有することで、同一の表現を両者で使用する。
  • 分類損失と補助的な自己教師あり損失の両方を最適化するように敵対的攻撃を定式化し、浄化メカニズムを把握している攻撃者を模擬する。
  • ラベルの変化には不変だが、敵対的ノイズによって引き起こされる分布シフトに敏感な自己教師ありタスクを選択し、効果的な摂動補正を可能にする。
  • 収束するまで反復的に浄化処理を実行し、補助損失を正則化項として用いて入力をクリーンで自然な表現へと誘導する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり表現学習を用いて、再訓練やモデル微調整なしにテスト時に敵対的例を浄化できるか?
  • RQ2自己教師あり信号のラベルに依存しない性質が、敵対的摂動の検出および逆転に有効であるか?
  • RQ3テスト時浄化手法が、最先端の敵対的訓練と同等のロバスト精度を達成しつつ、訓練の複雑さを低減できるか?
  • RQ4敵対的攻撃者が浄化メカニズムを把握している場合でも、防御が有効に機能するか?
  • RQ5本手法は画像に限らず、適切な自己教師ありタスクを用いれば他のデータモダリティにも一般化可能か?

主な発見

  • SOAPはMNISTおよびCIFAR-10で競争力あるロバスト精度を達成し、特にブラックボックスFGSM攻撃では標準的な敵対的訓練を上回る性能を示す。
  • FCNアーキテクチャでは、SOAP-DR(再構成ベース)がFGSMブラックボックス攻撃下で97.57%のロバスト精度を達成し、FGSM敵対的訓練(79.76%)を上回り、PGD敵対的訓練(96.02%)に近い性能を示す。
  • 攻撃者が防御を把握し、分類損失と補助損失の両方を最適化するように攻撃を設計した場合、特に再構成およびラベル整合性タスクでは攻撃成功率が低下する。
  • 回転予測タスクでは、攻撃のトレードオフパラメータが変化してもロバスト精度が安定しており、他のタスクと比較して攻撃に対してより感受性が強いことが示唆される。
  • 攻撃者が代替モデルを用いてブラックボックス敵対的例を生成する状況でも、本手法は強固な性能を維持しており、転送攻撃シナリオにおける耐性を示す。
  • テスト時の浄化処理は1サンプルあたり計算コストが極めて低いため、実世界の展開において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。