Skip to main content
QUICK REVIEW

[論文レビュー] A General Retraining Framework for Scalable Adversarial Classification

Bo Li, Yevgeniy Vorobeychik|arXiv (Cornell University)|Apr 9, 2016
Adversarial Robustness in Machine Learning参考文献 21被引用数 22
ひとこと要約

本稿では、任意の回避攻撃オラクルを用いて反復的に adversarial 例を生成・統合することで、任意の機械学習分類器の回避耐性を向上させる一般化された再訓練フレームワーク RAD を提案する。これは、最適 adversarial リスクの上界を最小化することで、10–30 フィーチャに制限されていた先行手法とは異なり、数千の特徴量にスケーラブルに拡張可能であり、ベースの学習アルゴリズムを変更せずに高い精度と耐性を維持する。

ABSTRACT

Traditional classification algorithms assume that training and test data come from similar distributions. This assumption is violated in adversarial settings, where malicious actors modify instances to evade detection. A number of custom methods have been developed for both adversarial evasion attacks and robust learning. We propose the first systematic and general-purpose retraining framework which can: a) boost robustness of an \emph{arbitrary} learning algorithm, in the face of b) a broader class of adversarial models than any prior methods. We show that, under natural conditions, the retraining framework minimizes an upper bound on optimal adversarial risk, and show how to extend this result to account for approximations of evasion attacks. Extensive experimental evaluation demonstrates that our retraining methods are nearly indistinguishable from state-of-the-art algorithms for optimizing adversarial risk, but are more general and far more scalable. The experiments also confirm that without retraining, our adversarial framework dramatically reduces the effectiveness of learning. In contrast, retraining significantly boosts robustness to evasion attacks without significantly compromising overall accuracy.

研究の動機と目的

  • 既存の adversarial 耐性向上手法が特定のモデルや小さな特徴量集合に限定されているという、スケーラビリティと汎用性の欠如という重要なギャップを埋める。
  • ベースの学習アルゴリズムを変更せずに、広範な回避攻撃のクラスに対して耐性を向上させる体系的で即挿し可能な再訓練フレームワークを構築すること。
  • 理論的にフレームワークを正当化し、最適 adversarial リスクの上界を最小化することを示す。これは、近似攻撃モデル下でも成立する。
  • 実験的に RAD が自動化された攻撃および人間による回避戦略の両方に対して、継続的な分類精度を維持しながら耐性を顕著に向上させることを検証すること。

提案手法

  • RAD は、回避オラクルを介して生成された adversarial 例を訓練データに統合することで分類器の耐性を向上させる、汎用的な再訓練ループを採用する。
  • フレームワークは、学習者と攻撃者の間の Stackelberg 博弈の二段階最適化定式化に基づいて導出された adversarial リスクの上界を最小化する。
  • 最適化ベースのモデル(例:ランダム再起動を伴う座標降下法)やデータ駆動型モデル(例:人間被験による人間の回避行動)を含む、任意の回避オラクルをサポートする。
  • 離散的および連続的特徴空間の両方で、座標単位のグリーディー摂動に基づく局所探索アルゴリズムを用いて、効率的な回避攻撃の近似を実現する。
  • 回避オラクルが近似である場合にも理論的保証を拡張し、adversarial リスクの上界に対する確率的緩和を用いる。
  • ベースの学習アルゴリズムに依存しないように設計されており、SVM やロジスティック回帰、ニューラルネットワークなどの任意の分類器と即挿しで統合可能である。

実験結果

リサーチクエスチョン

  • RQ1任意の学習アルゴリズムおよび回避モデルに適応可能な汎用的な再訓練フレームワークを設計できるか?
  • RQ2adversarial リスクの上界を最小化することで、実用的な耐性向上が達成されるとともに、クリーンデータにおける高い精度を維持できるか?
  • RQ3回避オラクルが近似であるか、人間の行動に基づく場合、このフレームワークはどの程度の性能を示すか?
  • RQ4従来の adversarial リスク最小化手法と比較して、高次元データ(例:数千の特徴量)へのスケーラビリティはどの程度向上するか?
  • RQ5フレームワークが生成する合成 adversarial 例は、現実世界の人間の回避行動を効果的にモデル化できるか?

主な発見

  • RAD は、最適 adversarial リスクを最小化する最先端の手法とほぼ同等の adversarial 耐性を達成するが、スケーラビリティが著しく向上しており、10–30 フィーチャに制限されていた従来手法とは異なり、数千の特徴量を処理可能である。
  • フレームワークはクリーンテストデータにおける全体の精度を維持するか、場合によっては向上させており、adversarial 再訓練が一般化性能を向上させることを示唆している。
  • 座標降下法にランダム再起動を用いるような近似オラクルを用いても、RAD は adversarial リスクのタイトな確率的上界を達成しており、理論的耐性が裏付けられている。
  • 人間による回避モデルを用いた実験では、RAD で訓練された分類器は依然として高い耐性を示しており、合成 adversarial 例が現実の人間の回避戦略を効果的にモデル化していることが示された。
  • RAD を用いた再訓練により、攻撃者が何回クエリを発行しても分類器は回避攻撃に対してほとんど感度を示さず、強力な耐性を示している。
  • スパムフィルタリングおよび手書き数字認識の両タスクにおいて、非 adversarial ベースラインでさえも、adversarial 耐性を特に設計していない場合でも、RAD が優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。