Skip to main content
QUICK REVIEW

[論文レビュー] Towards Adversarial Purification using Denoising AutoEncoders

Dvij Kalaria, Aritra Hazra|arXiv (Cornell University)|Aug 29, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、非微分可能な敵対的浄化フレームワークであるAPuDAEを提案する。この手法は、ノイズを含む入力を元に元の清浄な入力に復元するためのDenoising AutoEncoders (DAE) の再構成誤差を、段階的に最小化することで、敵対的入力を元の清浄な形に回復する。DAEの再構成誤差を段階的に低減させつつ画像品質を維持するように入力を繰り返し精錬することで、MNIST、CIFAR-10、ImageNet における強力な適応的攻撃に対して最先端の耐性を達成し、直接的なDAE適用や敵対的訓練よりも優れている。

ABSTRACT

With the rapid advancement and increased use of deep learning models in image identification, security becomes a major concern to their deployment in safety-critical systems. Since the accuracy and robustness of deep learning models are primarily attributed from the purity of the training samples, therefore the deep learning architectures are often susceptible to adversarial attacks. Adversarial attacks are often obtained by making subtle perturbations to normal images, which are mostly imperceptible to humans, but can seriously confuse the state-of-the-art machine learning models. We propose a framework, named APuDAE, leveraging Denoising AutoEncoders (DAEs) to purify these samples by using them in an adaptive way and thus improve the classification accuracy of the target classifier networks that have been attacked. We also show how using DAEs adaptively instead of using them directly, improves classification accuracy further and is more robust to the possibility of designing adaptive attacks to fool them. We demonstrate our results over MNIST, CIFAR-10, ImageNet dataset and show how our framework (APuDAE) provides comparable and in most cases better performance to the baseline methods in purifying adversaries. We also design adaptive attack specifically designed to attack our purifying model and demonstrate how our defense is robust to that.

研究の動機と目的

  • 安全で重要な応用分野における深層学習モデルが、人間の感覚では検出できない敵対的摂動に対して脆弱であるという問題に対処すること。
  • 単に敵対的入力を検出するのではなく、敵対的入力を浄化する防御メカニズムを開発すること。
  • 直接的なDAEに基づく浄化手法はしばしば画像をぼやけさせ、勾配に基づく攻撃に対して脆弱であるという点を改善すること。
  • 白箱および graysack 攻撃に対して耐性を持つ、非微分可能で適応的な浄化プロセスを設計すること。
  • 浄化メカニズムを標的とする新たな適応的攻撃に対して、耐性を評価すること。

提案手法

  • DAEは、ノイズを含む入力を元に元の清浄な画像を再構成するように学習し、データの背後にある分布を学習する。
  • 敵対的入力に直接DAEを適用するのではなく、段階的な更新によって再構成誤差を最小化するように入力を適応的に精錬する。
  • 段階的な精錬プロセスは、再構成誤差を低減する方向に画像入力を摂動させる勾配法を用い、εの球内に制約を課す。
  • 最適化の各ステップでランダムなノイズと変換を組み込むことで、最適化中のモード崩壊を回避し、耐性を向上させる。
  • 浄化プロセスは非微分可能であるため、防御メカニズムを標的とする勾配に基づく適応的攻撃に対して耐性を持つ。
  • 本フレームワークは、2種類の適応的攻撃を用いて評価される:1つは分類器を標的とする勾配上昇法、もう1つは分類器とDAE再構成誤差の両方の損失を組み合わせて、両方を同時にだます攻撃。

実験結果

リサーチクエスチョン

  • RQ1DAEの再構成誤差を適応的に最小化することで、クリアな特徴をぼやけさせることなく敵対的浄化を改善できるか?
  • RQ2直接的なDAE適用と比較して、非微分可能で繰り返し精錬された入力処理が、耐性と精度の面でどのように優れているか?
  • RQ3本手法は、分類器と防御メカニズムの両方を標的とする強力な適応的攻撃に耐えられるか?
  • RQ4精錬の各ステップで適応的ノイズと変換を使用することで、回避攻撃に対する耐性が向上するか?
  • RQ5多様なベンチマークにおいて、APuDAEは敵対的訓練や他の最先端の浄化手法と比較してどのように性能を発揮するか?

主な発見

  • MNISTでは、攻撃Aに対して89.1%、攻撃Bに対して85.7%の精度を達成し、直接的なDAE浄化(79.9%および81.5%)を顕著に上回った。
  • CIFAR-10では、攻撃Aに対して68.0%、攻撃Bに対して50.7%の精度を達成し、直接的なDAE手法(19.9%および27.5%)と敵対的訓練(48.3%)を上回った。
  • ImageNetでは、攻撃Aに対して53.6%、攻撃Bに対して40.7%の精度を達成し、直接的なDAE(13.4%および31.2%)と敵対的訓練(25.4%)を上回った。
  • 適応的浄化手法により、直接的なDAE適用と比較して画像のぼやけが軽減され、クリアな入力の分類精度が維持された。
  • 非微分性のおかげで、勾配に基づく適応的攻撃に対して耐性があり、直接的なDAEでは一貫した性能低下が見られたが、APuDAEではその傾向が見られなかった。
  • 最適化の各ステップでランダムなノイズと変換を統合することで、再構成感度が低いエッジに基づく攻撃に対して特に耐性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。