Skip to main content
QUICK REVIEW

[論文レビュー] High Dimensional Model Explanations: an Axiomatic Approach

Neel Patel, Martin Strobel|arXiv (Cornell University)|Jun 16, 2020
Explainable Artificial Intelligence (XAI)参考文献 43被引用数 5
ひとこと要約

本稿では、Banzhaf 相互作用指数(BII)を用いて高次元モデルの説明のための新しい公理的枠組みを提案する。この枠組みは、高次の特徴量相互作用を捉えることを可能にし、対称性、単調性、効率性といった望ましい性質を形式化することで、BII がこれらの公理を満たす唯一の説明手法であることを証明する。また、ブラックボックスモデルの最適な k 次多項式近似に対応することを示し、特徴量ごとの説明手法に比べて協調的効果をより効果的に捉えることを実証する。

ABSTRACT

Complex black-box machine learning models are regularly used in critical decision-making domains. This has given rise to several calls for algorithmic explainability. Many explanation algorithms proposed in literature assign importance to each feature individually. However, such explanations fail to capture the joint effects of sets of features. Indeed, few works so far formally analyze high-dimensional model explanations. In this paper, we propose a novel high dimension model explanation method that captures the joint effect of feature subsets. We propose a new axiomatization for a generalization of the Banzhaf index; our method can also be thought of as an approximation of a black-box model by a higher-order polynomial. In other words, this work justifies the use of the generalized Banzhaf index as a model explanation by showing that it uniquely satisfies a set of natural desiderata and that it is the optimal local approximation of a black-box model. Our empirical evaluation of our measure highlights how it manages to capture desirable behavior, whereas other measures that do not satisfy our axioms behave in an unpredictable manner.

研究の動機と目的

  • 複雑な機械学習モデルにおいて、特徴量ごとの説明手法が高次の特徴量相互作用を捉えられないという限界を解決すること。
  • 機械学習の文脈において、高次元モデルの説明に適した自然で望ましい公理のセットを形式化すること。
  • Banzhaf 相互作用指数(BII)が、これらの公理を満たす唯一の説明手法であることを証明すること。
  • BII とブラックボックスモデルの最適な多項式近似との間に接続を確立し、幾何学的および最適化に基づく正当性を提供すること。
  • 標準的手法が失敗する状況においても、BII が意味のある特徴量相互作用を捉えられることを実証的に示すこと。

提案手法

  • 対称性、極限条件、一般-2-効率性、および新たに提案された単調性公理の4つの核心的公理を用いて、高次元の説明手法を公理化する。
  • Banzhaf 相互作用指数(BII)を、これらの公理を満たす唯一の解として定義し、特徴量相互作用効果の忠実な表現を保証する。
  • ブラックボックスモデル f(·) を、すべての入力組み合わせ 2^N における全二乗誤差を最小化する k 次多項式 g_k(·) として近似する問題を定式化する。
  • 最適な k 次多項式近似における単項式 ∏_{i∈S} x_i の係数が、特徴量集合 S に対する BII 値に正確に一致することを証明する(定理 2)。
  • 最小二乗多項式近似を幾何学的および統計的基盤として用い、BII を統計学およびゲーム理論における標準的な相互作用の概念と結びつける。
  • 局所的線形近似に限る従来の特徴量ベースの説明を、相互作用効果を捉える高次多項式近似に拡張する。

実験結果

リサーチクエスチョン

  • RQ1どの公理の集合が、特徴量相互作用を忠実に捉える高次元モデルの説明を一意に特徴付けるか?
  • RQ2なぜ Banzhaf 相互作用指数が機械学習におけるモデルの説明手法として正当化できるかを形式的に示すにはどうすればよいか?
  • RQ3Banzhaf 相互作用指数を生成する自然な最適化問題は存在するか?
  • RQ4BII を用いた説明は、標準的な特徴量ごとの説明手法に比べて、実際のモデルにおける協調的効果をどれほど効果的に捉えられるか?
  • RQ5単調性といった重要な公理に違反した場合、説明手法にどのような影響が生じるか?

主な発見

  • Banzhaf 相互作用指数(BII)は、新しく提案された単調性条件を含む、提示された公理の集合を満たす唯一の説明手法である。
  • BII は、ブラックボックスモデルの最小二乗多項式近似における k 次単項式の係数に正確に一致し、幾何学的および最適化に基づく正当性を提供する。
  • 実証的評価により、標準的な特徴量ごとの説明手法が、テキストレビューにおける「not」と「bad」の併存による肯定的センチメントといった協調的効果を捉えられていないことが示された。
  • 単調性公理に違反する説明手法は、予測不能で直感に反する振る舞いを示すことがあり、たとえば「bad」と「not」を個別に評価すると高い負の影響を与える一方で、両者を併用すると肯定的効果が生じるという事例で顕著である。
  • BII を用いた手法は、特に強い相互作用効果が見られる状況において、真の特徴量サブセットの共同影響を捉えることができ、より信頼性が高く解釈可能な説明を提供する。
  • 理論的分析により、BII がブラックボックスモデルを k 次多項式で近似する際の全二乗誤差を最小化する意味で最適であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。