Skip to main content
QUICK REVIEW

[論文レビュー] Counterfactual Explanations & Adversarial Examples - Common Grounds, Essential Differences, and Potential Transfers.

Timo Freiesleben|arXiv (Cornell University)|Sep 11, 2020
Adversarial Robustness in Machine Learning参考文献 16被引用数 10
ひとこと要約

本稿は、反事後的説明(CEs)と adversarial examples(AEs)の間の概念的・数学的関係を確立し、両者が同じ最適化問題から生じることを示している。本稿では、実行可能(feasible)でないCEと、反論を受ける(contestating)CEの区別を導入し、AEsが反論を受けるCEの特定の部分集合であることを証明することで、CEsがより一般的な枠組みであり、広範な概念的・実用的意義を有することを位置づけている。

ABSTRACT

The same optimization problem underlies counterfactual explanations (CEs) and adversarial examples (AEs). While this is well known, the relationship between the two at the conceptual level remains unclear. The present paper provides exactly the missing conceptual link. We compare CEs and AEs with respect to their philosophical basis, aims, and modeling techniques. We argue that CEs are a more general object-class than AEs. In particular, we introduce the conceptual distinction between feasible and contesting CEs and show that AEs correspond to the latter.

研究の動機と目的

  • 反事後的説明(CEs)と adversarial examples(AEs)の概念的関係を明確化すること。両者は同じ最適化問題に起因するが、概念的に分離されている。
  • CEs と AEs 間の哲学的・目的志向的・モデリング的差異を特定・形式化すること。
  • CEs がより一般的な説明クラスであり、AEs がその特定で制限されたサブセットであることを示すこと。
  • 実行可能(feasible)でないCEと、反論を受ける(contestating)CEの区別を導入し、adversarial examples を理解するための新しい概念的レンズを提供すること。

提案手法

  • CEs と AEs が共通して持つ最適化問題を統一的な数学的枠組みで形式化すること。
  • 『実行可能CE』(feasible CEs)という概念を導入し、現実世界の文脈で現実的かつ実行可能な反事後的説明を定義すること。
  • 『反論を受けるCE』(contestating CEs)を、最小限の摂動によってモデルの意思決定に反論するものとして定義し、adversarial examples と一致させること。
  • この分類を用いて、AEs が摂動が最小限で人間には感知できない場合の、反論を受けるCEの特殊ケースであることを示すこと。
  • CEs と AEs の哲学的基盤を分析し、その目的を対比する:解釈可能性対モデルの耐性。
  • CEs が AEs を包含する概念的階層を確立し、AEs を制限された特定のクラスとして位置づけること。

実験結果

リサーチクエスチョン

  • RQ1同じ最適化問題に起因するが、反事後的説明と adversarial examples の間の概念的関係は何か?
  • RQ2同じ数学的問題から導かれるにもかかわらず、CEs と AEs の哲学的目的とモデリング目的はどのように異なるのか?
  • RQ3反事後的説明の理解において、実行可能CEと反論を受けるCEの区別がなぜ重要なのか?
  • RQ4adversarial examples が反事後的説明の特殊ケースであるとされる根拠は何か?
  • RQ5CEs からの知見が機械学習モデルの耐性を向上させることに寄与できるか、逆に AEs の知見が CEs の改善に役立つのか?

主な発見

  • 反事後的説明は adversarial examples よりもより一般的なクラスであり、AEs は最小限で人間には感知できない摂動によって定義される特定の部分集合である。
  • 実行可能CEと反論を受けるCEの区別は、adversarial examples が現実世界で実行不可能な極端な反事後的説明であるという性質を明確にする概念的枠組みを提供する。
  • adversarial examples は、現実世界の文脈で実行不可能な反論を受けるCEに正確に対応しており、実用的な解釈可能性の欠如を強調している。
  • 共通の最適化問題により CEs と AEs が統合されるが、その概念的役割は顕著に異なる:CEs は解釈可能性と実行可能性を目的とし、AEs はモデルの脆弱性を目的としている。
  • 本稿は、AEs が数学的形式としてはCEsとは本質的に異なるものではなく、実用的・哲学的意図においてのみ根本的に異なることを確立している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。