Skip to main content
QUICK REVIEW

[論文レビュー] Built-in Vulnerabilities to Imperceptible Adversarial Perturbations

Thomas Tanay, Jerone T. A. Andrews|arXiv (Cornell University)|Jun 19, 2018
Adversarial Robustness in Machine Learning参考文献 57被引用数 6
ひとこと要約

この論文は、自然な正確性を損なわせることなく、事前学習モデルに敵対的脆弱性を容易に埋め込むことができることを示している。線形層を傾けることで、低分散のデータ成分への感受性を高めることで、人間には検出できない摂動に対して脆弱なモデルを構築した。この手法により、スティガノグラムデコーダーや0.1%の汚染率でのポisons攻撃によっても、人間には検出できない摂動に対して脆弱なモデルを生成できる。

ABSTRACT

Designing models that are robust to small adversarial perturbations of their inputs has proven remarkably difficult. In this work we show that the reverse problem---making models more vulnerable---is surprisingly easy. After presenting some proofs of concept on MNIST, we introduce a generic tilting attack that injects vulnerabilities into the linear layers of pre-trained networks by increasing their sensitivity to components of low variance in the training data without affecting their performance on test data. We illustrate this attack on a multilayer perceptron trained on SVHN and use it to design a stand-alone adversarial module which we call a steganogram decoder. Finally, we show on CIFAR-10 that a poisoning attack with a poisoning rate as low as 0.1% can induce vulnerabilities to chosen imperceptible backdoor signals in state-of-the-art networks. Beyond their practical implications, these different results shed new light on the nature of the adversarial example phenomenon.

研究の動機と目的

  • 自然な性能に影響を与えないまま、堅牢なモデルを意図的に人間には検出できない敵対的摂動に対して脆弱にすることができるかを調査すること。
  • 機械学習のサービスやオンライン学習システムにおいて、隠れたバックドアを埋め込むことによる新たな実用的脅威を明らかにすること。
  • 低分散のデータ成分の役割を分析することで、深層ネットワークが敵対的例に対してなぜ脆弱であるかという理論的洞察を提供すること。
  • 異なる非堅牢な特徴を訓練後に行うことで、敵対的堅牢性と自然な正確性が本質的に矛盾しないことを実証すること。

提案手法

  • 線形層の重み行列を変更することで、学習データ内の低分散成分への感受性を高める「傾き攻撃」を提案する。
  • SVHNにおけるマルチレイヤーパーセプトロンに傾き攻撃を適用し、テスト精度を維持したまま人間には検出できない摂動に対して脆弱になることを示した。
  • モデルの意思決定境界にバックドア信号を埋め込むためのスタンドアロンの敵対的モジュールである「スティガノグラムデコーダー」を導入した。
  • CIFAR-10における最先端のネットワークに対して、0.1%の汚染率でのポisons攻撃を設計し、所望の人間には検出できないバックドア信号に対して脆弱性を誘発した。
  • 敵対的例生成時の勾配マスキングを防ぐためにソフトマックス温度をキャリブレーションし、有効な堅牢性評価を保証した。
  • フラットな楕円体モデルを用いて、敵対的脆弱性の幾何的起源を説明し、解像度が向上するに従い、MNIST、SVHN、CIFAR-10の画像データセット全体に一般化されることを示した。

実験結果

リサーチクエスチョン

  • RQ1自然なデータに対して堅牢モデルと同一の性能を示すが、人間には検出できない敵対的摂動に対して脆弱な分類器を構築できるか?
  • RQ2学習データ内の低分散成分が、線形層における敵対的脆弱性を誘発する役割を果たすか?
  • RQ3スティガノグラムデコーダーを用いて、事前学習済みモデルに隠れたバックドア脆弱性を埋め込むことができるか?
  • RQ4極めて低い汚染率でのポisons攻撃が、特定の人間には検出できない信号に対してどれほど堅牢性の失敗を誘発できるか?
  • RQ5敵対的脆弱性現象は、一般化性能の低さに起因するのか、それとも特徴空間の操作によって意図的に誘発できるのか?

主な発見

  • 傾き攻撃は、SVHNにおけるテスト精度を損なわせることなく、低分散のデータ成分への感受性を著しく高めた。
  • スティガノグラムデコーダーは、モデルの意思決定境界に人間には検出できないバックドア信号を埋め込むスタンドアロンの敵対的モジュールとして構築可能である。
  • CIFAR-10における最先端のモデルに対して、0.1%の汚染データのみで、所望の人間には検出できないバックドア信号に対して脆弱性を誘発できる。
  • フラットな楕円体モデルは、敵対的脆弱性を高次元のデータ分布の幾何的性質として説明でき、MNIST、SVHN、CIFAR-10のすべてのデータセットに一般化可能である。
  • 結果から、堅牢な特徴と非堅牢な特徴がモデル内で共存できることを示唆しており、敵対的脆弱性が自然分類に使われる同じ特徴に起因するという仮定に疑問を呈する。
  • 実験的検証により、自然な正確性を維持したまま、人間には検出できない摂動に対して脆弱なモデルを構築できることを示し、MLaaSおよびオンライン学習における新たな攻撃ベクトルを露呈した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。