Skip to main content
QUICK REVIEW

[論文レビュー] Evading classifiers in discrete domains with provable optimality guarantees

Bogdan Kulynych, Jamie Hayes|arXiv (Cornell University)|Oct 25, 2018
Adversarial Robustness in Machine Learning参考文献 68被引用数 20
ひとこと要約

本稿では、離散的ドメインにおける敵対的攻撃を重み付き変換グラフ内のパスファインディングとしてモデル化するグラフィカルフレームワークを導入し、A∗探索を用いて証明可能な最小コストの敵対的例を生成する。この手法は既存の攻撃を一般化し、金融コストを含む任意のコスト関数をサポートし、ドメイン制約下での形式的ロバストネス保証を提供する。実験では、Twitterボット検出およびプライバシー指紋認識分類器で有効性を示した。

ABSTRACT

Machine-learning models for security-critical applications such as bot, malware, or spam detection, operate in constrained discrete domains. These applications would benefit from having provable guarantees against adversarial examples. The existing literature on provable adversarial robustness of models, however, exclusively focuses on robustness to gradient-based attacks in domains such as images. These attacks model the adversarial cost, e.g., amount of distortion applied to an image, as a $p$-norm. We argue that this approach is not well-suited to model adversarial costs in constrained domains where not all examples are feasible. We introduce a graphical framework that (1) generalizes existing attacks in discrete domains, (2) can accommodate complex cost functions beyond $p$-norms, including financial cost incurred when attacking a classifier, and (3) efficiently produces valid adversarial examples with guarantees of minimal adversarial cost. These guarantees directly translate into a notion of adversarial robustness that takes into account domain constraints and the adversary's capabilities. We show how our framework can be used to evaluate security by crafting adversarial examples that evade a Twitter-bot detection classifier with provably minimal number of changes; and to build privacy defenses by crafting adversarial examples that evade a privacy-invasive website-fingerprinting classifier.

研究の動機と目的

  • マルウェア、スパム、ボット検出などの離散的かつ制約付きドメインにおける、証明可能な敵対的ロバストネス保証の欠如に対処すること。
  • ℓp-ノルムに依存する既存の勾配ベースの攻撃が、離散的かつ実行可能な変換空間には不適切であるという制限を克服すること。
  • 任意のコスト関数をカスタマイズ可能な変換の有効なパスとして、敵対的攻撃をグラフ探索として形式化すること。
  • 連続ドメインのロバストネスをヒューリスティックとして用い、A∗探索を用いて最小コストの敵対的例を証明可能な最適性保証で得ること。
  • 金融的・運用的コストを含む現実的な敵対者制約下での分類器のロバストネス評価を可能にすること。

提案手法

  • 可能な敵対的操作の空間を、ノードが例、エッジが関連するコストを持つ重み付き有向グラフ(変換グラフ)として表現する。
  • 変換コストをエッジの重みとしてモデル化し、ℓp-ノルムを超える任意のコスト関数(例:金融的コスト、意味的コスト)を許容する。
  • 連続的スーパーセットにおけるℓp-ロバストネスから導出されるヒューリスティックで誘導されるA∗探索を用い、変換グラフ上で証明可能な最小総コストの敵対的例を特定する。
  • 分類器のホワイトボックス知識を活用してA∗用のロバストネスヒューリスティックを計算し、複雑な離散空間においても最適なパスファインディングを保証する。
  • 分類器と変換グラフを分離することで、白ボックスおよびブラックボックス設定をサポートし、異なる分類器や攻撃シナリオにおいても再利用可能である。
  • 連続的ロバストネスの計算が高コストである場合でも、部分的に最適でないがコスト保証のあるA∗の変種を可能にし、解の品質に対する理論的境界を維持する。

実験結果

リサーチクエスチョン

  • RQ1離散ドメインにおける敵対的攻撃を、実行可能性制約と任意のコスト関数を捉えるグラフ探索問題として形式化できるか?
  • RQ2ℓp-ノルムが適用できない離 discrete ドメインにおいて、最小敵対的コストをどのように保証できるか?
  • RQ3連続ドメインにおける敵対的ロバストネス測定値が、離散的グラフ探索の有効なヒューリスティックとしてどの程度機能するか?
  • RQ4このフレームワークは、実世界の応用においてセキュリティのロバストネスとプライバシー防御の両方を評価するために使用できるか?
  • RQ5このフレームワークは、テキスト、コード、ネットワークトラフィックなどの離散ドメインにおける既存の攻撃を、一般化または包含するか?

主な発見

  • 提案された変換グラフフレームワークは、語の置換、バイナリ変異、特徴量操作といった既存の攻撃を、グラフ上のパスとしてモデル化することで、離散ドメインにおける攻撃を一般化する。
  • 連続ドメインにおけるℓp-ロバストネスのヒューリスティックを用いたA∗探索により、離散的環境において証明可能な最小コストの敵対的例が得られる。
  • 本フレームワークは、ℓp-ノルムではモデル化できない金融コストなどの任意のコスト関数をサポートし、現実的な敵対的コストモデルを可能にする。
  • 本手法により、検出を回避するために必要な最小変更数について、Twitterボット分類器のロバストネスを証明可能な保証とともに評価できる。
  • 本フレームワークはプライバシー応用にも対応し、ウェブサイト指紋認識分類器に対する防御の費用対効果を評価するために、最小コストの敵対的例を生成可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。