Skip to main content
QUICK REVIEW

[論文レビュー] A Formal Framework to Characterize Interpretability of Procedures

Amit Dhurandhar, Vijay S. Iyengar|arXiv (Cornell University)|Jul 12, 2017
Explainable Artificial Intelligence (XAI)参考文献 16被引用数 15
ひとこと要約

この論文は、$δ$-解釈可能性に基づく形式的フレームワークを導入し、解釈可能性を人間中心ではなく、ターゲットモデル(TM)に相対的に定義する。解釈可能性は、手順からの情報提供によってターゲットモデルの性能向上($\geq\delta$)を測定することで定量化され、線形モデルや複雑なシステムを含む多様なモデルにおける正確性、耐性、適用可能性の観点から、異なる手法の比較が可能になる。

ABSTRACT

We provide a novel notion of what it means to be interpretable, looking past the usual association with human understanding. Our key insight is that interpretability is not an absolute concept and so we define it relative to a target model, which may or may not be a human. We define a framework that allows for comparing interpretable procedures by linking it to important practical aspects such as accuracy and robustness. We characterize many of the current state-of-the-art interpretable methods in our framework portraying its general applicability.

研究の動機と目的

  • 解釈可能性を人間中心の性質として再定義するのではなく、ターゲットモデル(TM)に結びついた相対的でパフォーマンスに基づく概念として定義すること。
  • 正確性、耐性、多様なTM(人間、線形モデル、複雑なシステムなど)への適用可能性に基づき、解釈可能な手順の比較が可能な形式的で一般化可能なフレームワークを提供すること。
  • 医療やマルウェア検出の実世界の設定において、最先端の解釈可能な手法を同定することで、フレームワークの適用可能性を示すこと。
  • 解釈可能性の評価を人間の理解を超えて可能にし、ターゲットモデルが機械学習モデルや超人的能力を持つシステムである場合にも対応できること。
  • 測定可能なパフォーマンス向上($\delta$)と分布シフトや敵対的条件下での耐性($\gamma$)に基づき、解釈可能性を形式化すること。

提案手法

  • ターゲットモデル $M_T$ がターゲット分布 $D_T$ において性能を $\delta$ 以上向上させる手順 $P_I$ を $δ$-解釈可能性として定義する。
  • 解釈可能性を通信タスクとして定式化:手順は、特徴量の重みや選択された特徴量といった、ターゲットモデルが処理可能な形式で情報を伝達しなければならない。
  • ターゲット分布を元の分布または特徴空間の特定領域に焦点を当てた再重み付けされたバージョンとして定義することで、グローバルおよびローカル解釈可能性を両立させる。
  • 分布シフトや敵対的摂動の下でも性能向上が保たれるように、$\gamma$-解釈可能性を導入して耐性を強化する。
  • 健康ケアの例(Chang & Weiner, 2010)を用いて、264次元の複雑なモデルが特徴量マッピングにより32次元の線形ターゲットモデルに $δ$-解釈可能に変換され、平均絶対予測誤差(MAPE)が有意に改善されることを示す。
  • 複数の分布と感度閾値($\alpha$)を拡張し、類似した解釈可能性パフォーマンスを示すモデルの同値類を定義する。

実験結果

リサーチクエスチョン

  • RQ1人間の理解に依存せず、任意のターゲットモデルに適用可能な、解釈可能性の形式的定義はどのように可能か?
  • RQ2解釈可能性におけるパフォーマンス向上($\delta$)とは何か? そして、異なる種類のターゲットモデルにおいて、どのように測定可能か?
  • RQ3ターゲットモデルが人間でない場合(例:線形モデルやニューラルネットワーク)に、解釈可能性を意味的に比較可能か?
  • RQ4耐性($\gamma$)は解釈可能性にどのように関与し、どのような状況で重要な懸念事項となるか?
  • RQ5感度閾値($\alpha$)を用いて、ローカル解釈可能性、分布シフト、運用的意義をどの程度フレームワークがカバーできるか?

主な発見

  • このフレームワークは、医療分野(ACGシステム)やマルウェア検出における既存の解釈可能な手法を、ターゲットモデルに対するパフォーマンス向上($\delta$)を測定することで、的確に特徴づけた。
  • 医療分野の例では、264次元のEDCモデルが、32次元の線形モデル(ADGシステム)に対して $δ$-解釈可能にされ、平均絶対予測誤差(MAPE)が測定可能な程度に改善された。
  • このフレームワークは、解釈可能性がモデルの複雑さに本質的に結びついていないことを明らかにした。深層学習モデルですら、ターゲットモデルの性能を $\delta$ 以上向上させる限り、解釈可能である。
  • 耐性($\gamma$)は、テストセットに不完全性がある場合にのみ懸念事項となることが示され、解釈可能性の評価における分布仮定の重要性が浮き彫りになった。
  • 感度閾値 $\alpha$ を用いることで、同値類の定義が可能となり、異なる手法間での解釈可能性パフォーマンスの運用的比較が可能になった。
  • このアプローチは人間中心の解釈可能性を越えて一般化され、線形モデル、決定木、あるいは超人的能力を持つシステムといった非人間のターゲットモデルに対しても、解釈可能性の評価が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。