Skip to main content
QUICK REVIEW

[論文レビュー] Provably Precise, Succinct and Efficient Explanations for Decision Trees

Yacine Izza, Alexey Ignatiev|arXiv (Cornell University)|May 19, 2022
Explainable Artificial Intelligence (XAI)被引用数 8
ひとこと要約

本稿では、δ関連集合を用いて、決定木の要約的で、証明可能に正確な説明を計算する、新しいアプローチを提案する。δ関連集合は、要約性と正確性のバランスを取る近似説明である。2つのSMTエンコードと多項式時間アルゴリズムを導入し、実際には、ほとんど無視できる実行時間でサブセット最小の説明が得られ、Anchorのようなモデルに依存しない手法よりも、品質と効率の両面で優れている。

ABSTRACT

Decision trees (DTs) embody interpretable classifiers. DTs have been advocated for deployment in high-risk applications, but also for explaining other complex classifiers. Nevertheless, recent work has demonstrated that predictions in DTs ought to be explained with rigorous approaches. Although rigorous explanations can be computed in polynomial time for DTs, their size may be beyond the cognitive limits of human decision makers. This paper investigates the computation of δ-relevant sets for DTs. δ-relevant sets denote explanations that are succinct and provably precise. These sets represent generalizations of rigorous explanations, which are precise with probability one, and so they enable trading off explanation size for precision. The paper proposes two logic encodings for computing smallest δ-relevant sets for DTs. The paper further devises a polynomial-time algorithm for computing δ-relevant sets which are not guaranteed to be subset-minimal, but for which the experiments show to be most often subset-minimal in practice. The experimental results also demonstrate the practical efficiency of computing smallest δ-relevant sets.

研究の動機と目的

  • 決定木における長い意思決定経路が人間の理解能力を超えることによる認知的負荷を軽減すること。
  • 短縮性と証明可能な正確性を両立させつつ、大幅なサイズ削減の代わりに最小限の正確性損失を許容する、計算的に効率的な説明生成手法を開発すること。
  • 一般モデルにおける近似説明の高い計算複雑性を克服し、決定木という特定のケースにおいては tractable(扱いやすい)であることを示すこと。
  • 実験的に、提案手法が、モデルに依存しない解釈手法とは異なり、実際にはサブセット最小の説明を生成することを検証すること。
  • 人間が解釈可能なサイズにまで小さくできないきわめて大きな解釈を伴う厳密な帰納的説明のスケーラブルな代替手段を提供すること。

提案手法

  • δ関連集合を、厳密な説明の一般化として提案し、信頼度の閾値δを用いて、説明のサイズと正確性のトレードオフを可能にする。
  • 決定木における最小のδ関連集合(WeakPAXp)を計算するための、非線形および線形算術を用いた2つのSMTエンコードを開発する。
  • 最小δ関連集合の過剰近似を計算する多項式時間アルゴリズム(ApproxPAXp)を導入し、実際にはサブセット最小であることが示された。
  • NPオракルを用いた反復的精錬により、最小δ関連集合を計算し、コール回数を対数的に削減する。
  • 論理ベースのフレームワークを用いて特徴量の制約と経路整合性をエンコードし、効率的なSAT/SMTソルビングを可能にする。
  • SMTソルビングを用いて手法を検証し、最先端のモデルに依存しない解釈手法であるAnchorとの結果を比較する。

実験結果

リサーチクエスチョン

  • RQ1一般モデルでは高い複雑性を示すが、決定木においてはδ関連集合を効率的に計算できるか?
  • RQ2要約的かつ証明可能な正確性を持つ説明を計算可能であり、正確性の下限が保証できるか?
  • RQ3δ関連集合のための多項式時間アルゴリズムが、実際にはほぼサブセット最小の説明を生成できるか?
  • RQ4提案手法は、Anchorのようなモデルに依存しない解釈手法と比較して、サイズ、正確性、実行時間の面で優れているか?
  • RQ5SMTエンコードは、大規模な決定木に対してもスケーラブルであり、効率性と正確性を維持できるか?

主な発見

  • 提案されたSMTエンコードは効果的にスケーリングされ、大規模な決定木では平均実行時間が20秒未塔である。ApproxPAXpアルゴリズムは0.01秒未塔で実行される。
  • ApproxPAXpの説明は実際にはサブセット最小であり、dermatology、soybean、textureの各データセットで98%以上の精度を達成している。
  • spambaseデータセットでは、説明の特徴量数を10から5に削減しながら、精度が0.95以上を維持しており、効果的な圧縮が実証された。
  • 説明の平均サイズは7±2であり、ミラーの法則による人間の認知限界(7±2個)の範囲内に収まっている。
  • Anchorは一貫した経路との重複率が20%未塔であり、低品質な説明を生成しており、著しく遅い。
  • 結果から、モデルに依存しない解釈手法(Anchor)は、正確性の保証と要約性の両方を満たさないことが確認された。これに対して、提案された論理ベースのアプローチは、両方を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。