Skip to main content
QUICK REVIEW

[論文レビュー] A Research Agenda: Dynamic Models to Defend Against Correlated Attacks

Ian Goodfellow|arXiv (Cornell University)|Mar 14, 2019
Adversarial Robustness in Machine Learning参考文献 10被引用数 12
ひとこと要約

本論文は、推論中に継続的に適応する動的機械学習モデルを提案し、入力が繰り返されたり依存関係を持ったりする「相関テスト時攻撃」に対して防御することを目的としている。攻撃者は固定モデルの欠陥を悪用する。『Hello World』の例として、記憶に基づく拒否機構を備えた動的モデルが、このような攻撃に対してほぼ完璧な耐性を示すことを示しており、将来的な防御において動的挙動が不可欠であると主張している。

ABSTRACT

In this article I describe a research agenda for securing machine learning models against adversarial inputs at test time. This article does not present results but instead shares some of my thoughts about where I think that the field needs to go. Modern machine learning works very well on I.I.D. data: data for which each example is drawn {\em independently} and for which the distribution generating each example is {\em identical}. When these assumptions are relaxed, modern machine learning can perform very poorly. When machine learning is used in contexts where security is a concern, it is desirable to design models that perform well even when the input is designed by a malicious adversary. So far most research in this direction has focused on an adversary who violates the {\em identical} assumption, and imposes some kind of restricted worst-case distribution shift. I argue that machine learning security researchers should also address the problem of relaxing the {\em independence} assumption and that current strategies designed for robustness to distribution shift will not do so. I recommend {\em dynamic models} that change each time they are run as a potential solution path to this problem, and show an example of a simple attack using correlated data that can be mitigated by a simple dynamic defense. This is not intended as a real-world security measure, but as a recommendation to explore this research direction and develop more realistic defenses.

研究の動機と目的

  • 攻撃者が入力同士の依存関係を悪用する固定モデルの脆弱性に対処すること。
  • 現実世界のセキュリティ環境において、i.i.d.データや独立したテスト例が十分であるという仮定に疑問を呈すること。
  • 静的モデルでさえ、確率的要素があっても本質的に脆く、一度の悪意ある入力が特定されれば、それを繰り返し悪用できると主張すること。
  • 時間とともに変化する動的モデルを、将来的な強固な防御の基盤として推奨すること。
  • 自信閾値、アクティブラーニング、クエリレート制限など、動的挙動と相乗効果をもたらす防御メカニズムを検討すること。

提案手法

  • デプロイ中に継続的に意思決定関数を変更する動的モデルを設計し、攻撃者が挙動を予測できないようにする。
  • 記憶防御を実装し、繰り返し出現する入力を検出し、分類を拒否することで、既知の誤りの悪用を防ぐ。
  • 入力の摂動を悪意ある制御下でモデル化する変換関数 $ f({m{x}}, {m{ heta}}) $ を使用し、$ {m{ heta}} $ は動的モデルパラメータを表す。
  • 以前に見た例と一致する入力が検出された場合に、拒否機構が発動し、一貫した誤分類のリスクを低減する。
  • 不確実な予測(意思決定境界付近)を拒否するために、自信閾値と組み合わせた動的モデルの提案。
  • 懸念される入力が検出された際に、真のラベルを要求するアクティブラーニングを統合し、長期的な耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1推論中に変化する動的モデルは、たった一つの悪意ある入力を繰り返し使用するような相関テスト入力攻撃を緩和できるか?
  • RQ2固定モデルは独立した摂動に対しては耐性があるが、なぜ相関攻撃では失敗するのか?
  • RQ3動的挙動と、拒否やアクティブラーニングといった他のメカニズムをどのように組み合わせて耐性を向上させられるか?
  • RQ4攻撃者がモデルの挙動を観測・適応可能である状況で、モデルの予測不能性が果たす役割は何か?
  • RQ5制御された攻撃シナリオにおいて、単純な動的防御機構が静的モデルよりも著しく優れた耐性を達成できるか?

主な発見

  • 記憶と拒否に基づく単純な動的防御は、固定モデルの誤差率が100%に達する標的攻撃に対して100%の耐性を達成できる。
  • 固定モデル、たとえ確率的であっても、一度の悪意ある入力が特定されれば、それを繰り返し悪用可能であるため、相関攻撃に対して脆弱である。
  • 時間とともに変化する動的モデルは、攻撃者がモデル挙動を正確に予測できなくなるため、攻撃可能なパターンを特定するのが難しくなる。
  • 動的挙動と拒否機構の組み合わせは、特に非標的攻撃環境において耐性を顕著に向上させる。
  • 動的モデルは必須だが、それだけでは不十分である。実用的導入にはアクティブラーニングやクエリレート制限といった補完的要素が不可欠である可能性が高い。
  • 『Hello World』の例は、動的モデルが静的モデルを上回る耐性を示せることを示しており、実用的でない場合でも有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。