[論文レビュー] From Formal Boosted Tree Explanations to Interpretable Rule Sets
本稿では、XGBoostedブーストツリーのヒューリスティックな説明の検証、修復、精錬を、制約に基づく帰納による計算で、グローバルに正しい最小の説明を用いて行う論理的フレームワーク、XPlainerを提案する。AnchorとLIMEの説明はしばしばグローバルに誤りであることが判明し、2つのデータセットにおいて、Anchorは99%以上のケースで楽観的である。これは、ヒューリスティックな説明のグローバルな検証の重要性が極めて高いことを示している。
Recent years have witnessed a fast-growing interest in computing explanations for Machine Learning (ML) models predictions. For non-interpretable ML models, the most commonly used approaches for computing explanations are heuristic in nature. In contrast, recent work proposed rigorous approaches for computing explanations, which hold for a given ML model and prediction over the entire instance space. This paper extends earlier work to the case of boosted trees and assesses the quality of explanations obtained with state-of-the-art heuristic approaches. On most of the datasets considered, and for the vast majority of instances, the explanations obtained with heuristic approaches are shown to be inadequate when the entire instance space is (implicitly) considered.
研究の動機と目的
- ヒューリスティックなML説明にグローバルな保証がない問題に対処すること。これらは局所的に計算され、全インスタンス空間全体で失敗する可能性がある。
- ブーストツリーに対してスケーラブルな制約ベースの符号化を開発し、帰納的推論を用いてグローバルに正しい最小の説明を計算すること。
- 検証、修復(楽観的の場合)、精錬(楽観的でない場合)のためのアルゴリズムを設計・実装すること。
- グローバルに正しい説明をゴールドスタンダードとして用い、最先端のヒューリスティックな説明(LIMEとAnchor)の質を実証的に評価すること。
提案手法
- XGBoostedブーストツリーの新規な制約ベースの符号化を提案し、帰納的推論を用いてグローバルな説明を効率的に計算可能にする。
- SATベースの推論を用いて、サブセット最小および基数最小の説明を計算し、グローバルな正しさと最小性を保証する。
- 論理的一致性のチェックとインスタンス空間全体での最小化を用いて、検証・修復・精錬のアルゴリズムをXPlainerツールに統合する。
- 必要なときにのみ説明を計算するオンデマンド帰納を採用し、完全コンパイルアプローチに比べてスケーラビリティを向上させる。
- XGBoostモデルとトレーニング済みのインスタンス空間を用い、ヒューリスティックな説明をグローバルな説明の真値と照らし合わせて評価する。
- 論理的フレームワークを用いて、ヒューリスティックな説明に含まれる余分なリテラル(楽観的)と必要なリテラルの欠落(楽観的)を検出する。
実験結果
リサーチクエスチョン
- RQ1XGBoostドモデルに対してグローバルに正しい最小の説明と照らし合わせた場合、ヒューリスティックな説明(例:LIMEとAnchor)の正確さはどの程度か?
- RQ2ヒューリスティックな説明は、どれほど楽観的(すなわち、インスタンス空間の大部分で適用されない)または楽観的でない(すなわち、余分な特徴を含む)か?
- RQ3XPlainerのような論理的フレームワークは、ブーストツリーのヒューリスティックな説明の検証、修復、精錬を効果的に行えるか?
- RQ4ヒューリスティック手法(LIME や Anchor)と比較して、グローバルに正しい説明を計算する際の計算コストはどの程度か?
主な発見
- 2つのデータセットにおいて、Anchorは99%以上のインスタンスで楽観的であり、入力空間の99%以上でグローバルに適用されないことを意味する。
- 他の2つのデータセットにおいても、Anchorは80%以上のインスタンスで楽観的であり、その説明が広範にグローバルに不正確であることが示された。
- LIMEはAnchorよりも楽観的でない傾向にあるが、どちらの手法も楽観的の度合いにおいて優劣がないことが判明し、両者とも重大なグローバルな信頼性の問題を抱えていることが示された。
- XPlainerが計算するグローバルな説明は、構成上、サブセット最小または基数最小であるため、楽観的でも楽観的でもない。
- XPlainerのサブセット最小説明の平均サイズは、全特徴の15〜50%であり、基数最小説明では15〜36%にまで削減され、解釈可能性が向上した。
- XPlainerの実行時間はLIMEやAnchorと同等であり、検証は無視できるほど短く、サブセット最小モードでは基数最小モードよりも修復/精錬が高速である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。