Skip to main content
QUICK REVIEW

[論文レビュー] Game-theoretic Understanding of Adversarially Learned Features.

Jie Ren, Die Zhang|arXiv (Cornell University)|Mar 12, 2021
Adversarial Robustness in Machine Learning参考文献 58被引用数 6
ひとこと要約

本稿は、多次元相互作用に基づくゲーム理論的枠組みを提示し、深層ニューラルネットワーク(DNNs)における敵対的ロバストネスを分析する。敵対的攻撃は主に高次元特徴相互作用を破壊するが、敵対的訓練を経たモデルのロバストネスは、カテゴリー固有の低次元相互作用に起因しており、特徴の形状バイアスおよび敵対的例の回復可能性に関する新たな知見を提供する。

ABSTRACT

This paper aims to understand adversarial attacks and defense from a new perspecitve, i.e., the signal-processing behavior of DNNs. We novelly define the multi-order interaction in game theory, which satisfies six properties. With the multi-order interaction, we discover that adversarial attacks mainly affect high-order interactions to fool the DNN. Furthermore, we find that the robustness of adversarially trained DNNs comes from category-specific low-order interactions. Our findings provide more insights into and make a revision of previous understanding for the shape bias of adversarially learned features. Besides, the multi-order interaction can also explain the recoverability of adversarial examples.

研究の動機と目的

  • DNNにおける信号処理の観点から、敵対的攻撃と防御を理解すること。
  • 6つの公理的性質を満たすゲーム理論における新しい多次元相互作用概念を定義すること。
  • 敵対的例が特徴相互作用をどのように操作するか、およびロバストモデルがそのような操作に抵抗する理由を調査すること。
  • 相互作用に基づく分析を用いて、敵対的訓練された特徴に観察される形状バイアスを説明すること。
  • 相互作用レベルの再構成を通じて、敵対的例の回復可能性を明確にすること。

提案手法

  • 6つの公理的性質を満たす特徴相互作用分析のための新しいゲーム理論的多次元相互作用フレームワークを提案すること。
  • DNNの特徴表現を入力特徴間の協力的ゲームとしてモデル化し、多次元相互作用を定量化すること。
  • シャープレー値および高次元相互作用インデックスを用いて、さまざまな次数の特徴寄与度を分解すること。
  • 敵対的攻撃がロバストモデルでは低次元相互作用を保持する一方で、高次元相互作用を変更することを分析すること。
  • 敵対的例は、破壊された高次元相互作用を再構成することで回復可能であることを示すこと。
  • フレームワークを用いて、ロバストモデルにおける低次元相互作用のカテゴリー固有性を分析すること。

実験結果

リサーチクエスチョン

  • RQ1敵対的攻撃は、深層ニューラルネットワーク特徴の相互作用構造をどのように主に影響するか?
  • RQ2なぜ敵対的訓練を経たモデルは改善されたロバストネスを示すのか、そして低次元相互作用はその役割を果たすのか?
  • RQ3特徴相互作用の再構成によって、敵対的例はどの程度回復可能か?
  • RQ4多次元相互作用フレームワークは、敵対的学習された特徴における形状バイアスをどのように説明するか?
  • RQ5DNNにおける相互作用次数とモデルのロバストネスの関係は何か?

主な発見

  • 敵対的攻撃は、通常のDNNにおける意思決定に不可欠な高次元特徴相互作用を主に破壊する。
  • 敵対的訓練を経たモデルのロバストネスは、攻撃下でも安定したカテゴリー固有の低次元相互作用に起因する。
  • 多次元相互作用フレームワークは、敵対的訓練された特徴における形状バイアスを、低次元相互作用の選択的保存という結果として説明できる。
  • 敵対的例は、高次元相互作用が変更されても、相互作用分解フレームワークを用いて再構成可能であるため、回復可能である。
  • 提案された多次元相互作用モデルは6つの公理的性質を満たしており、DNNにおける相互作用分析に厳密な基盤を提供する。
  • フレームワークは、ロバストネスがグローバルな特徴安定性によるものではなく、局所的かつカテゴリー固有の低次元相互作用の保存によるものであることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。