Skip to main content
QUICK REVIEW

[論文レビュー] Do We Need Another Explainable AI Method? Toward Unifying Post-hoc XAI Evaluation Methods into an Interactive and Multi-dimensional Benchmark

Mohamed Karim Belaid, Eyke Hüllermeier|arXiv (Cornell University)|Jun 8, 2022
Explainable Artificial Intelligence (XAI)被引用数 8
ひとこと要約

本稿では、ポスト・ホック型説明可能AI(xAI)アルゴリズムの機能的テスト手法を統合するインタラクティブで多次元のベンチマーク、Compare-xAIを紹介する。非重複テストの選定プロトコルを提案し、一般ユーザー、実務者、研究者という3段階の専門性レベルでアルゴリズムをスコア化し、直感的なUIを用いて誤用を低減する。最高と最低のスコアの平均差は71.9%に達し、失敗したテストの中央値故障率は17.6%、部分的に失敗したテストは38.7%に達する。

ABSTRACT

In recent years, Explainable AI (xAI) attracted a lot of attention as various countries turned explanations into a legal right. xAI allows for improving models beyond the accuracy metric by, e.g., debugging the learned pattern and demystifying the AI's behavior. The widespread use of xAI brought new challenges. On the one hand, the number of published xAI algorithms underwent a boom, and it became difficult for practitioners to select the right tool. On the other hand, some experiments did highlight how easy data scientists could misuse xAI algorithms and misinterpret their results. To tackle the issue of comparing and correctly using feature importance xAI algorithms, we propose Compare-xAI, a benchmark that unifies all exclusive functional testing methods applied to xAI algorithms. We propose a selection protocol to shortlist non-redundant functional tests from the literature, i.e., each targeting a specific end-user requirement in explaining a model. The benchmark encapsulates the complexity of evaluating xAI methods into a hierarchical scoring of three levels, namely, targeting three end-user groups: researchers, practitioners, and laymen in xAI. The most detailed level provides one score per test. The second level regroups tests into five categories (fidelity, fragility, stability, simplicity, and stress tests). The last level is the aggregated comprehensibility score, which encapsulates the ease of correctly interpreting the algorithm's output in one easy to compare value. Compare-xAI's interactive user interface helps mitigate errors in interpreting xAI results by quickly listing the recommended xAI solutions for each ML task and their current limitations. The benchmark is made available at https://karim-53.github.io/cxai/

研究の動機と目的

  • アルゴリズムと評価手法の増加に伴い、実務者がポスト・ホック型説明可能AI(xAI)手法の選定および正しく解釈することが難しくなっているという課題に対処すること。
  • アルゴリズムの限界についての明確な理解が欠如しているために、データサイエンティストがxAIの結果を誤解する『説明の深さの錯覚』を軽減すること。
  • 文献に散在する多様な機能的テスト手法を、標準化されスケーラブルなベンチマークに統合すること。
  • アルゴリズムの限界を明示し、一般ユーザー、実務者、研究者という異なる専門性レベルのユーザーの意思決定を支援する、透明性がありインタラクティブなインターフェースを提供すること。
  • 階層的スコアリングシステムを通じて、パフォーマンス、脆弱性、限界を即座に可視化することで、xAIツールの誤用を低減すること。

提案手法

  • 文献から、忠実度、感受性、安定性、単純性、ストレステストなど、個別のエンドユーザー要件を満たす非重複な機能的テストを短縮選定するためのプロトコルを提案する。
  • 3段階の階層的スコアリングシステムを設計する:(1) 個々のテストごとのスコア、(2) 忠実度、感受性、安定性、単純性、ストレスの5つのカテゴリースコア、(3) 一般ユーザー向けのグローバルな理解可能性スコア。
  • 各xAIアルゴリズムを固定された機械学習モデルに対してブラックボックスでエンドツーエンド評価するプロトコルを採用し、出力が期待される説明と一致するかを検証する。
  • テスト結果を可視化し、アルゴリズムの限界を強調し、MLタスクごとに適切なxAIツールを素早く経路選択できる、インタラクティブなウェブベースのユーザーインターフェースを開発する。
  • 客観性と再現性を確保するため、主観的な人間評価を避けて、定量的指標のみを評価に用いる。
  • 40余りの研究論文の結果を統合し、22の機能的テストを用いて16以上の中間後説明可能AIアルゴリズムを評価する。結果は継続的に再評価され、最新の関連性を維持する。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、xAI説明における個別のエンドユーザー要件(忠実度、感受性、安定性、単純性、ストレステストなど)をそれぞれ別個に満たす、非重複な機能的テストを文献から選定できるか?
  • RQ2多数の評価次元とユーザーの専門性レベルが存在する中で、xAIアルゴリズムを単純かつスケーラブルにスコア化する方法は何か?
  • RQ3透明性があり、インタラクティブで解釈可能なベンチマーキングを通じて、データサイエンティストによるxAIアルゴリズムの誤用をどのように低減できるか?

主な発見

  • 忠実度、感受性、安定性、単純性、ストレスの5つのサブカテゴリ間での最高スコアと最低スコアの平均差は71.9%(±31.4%)であり、xAI手法間での顕著なパフォーマンス差が示された。
  • すべてのxAIアルゴリズムにおける失敗テスト(スコア < 0.05)の中央値は17.6%、部分的に失敗したテスト(0.05 ≤ スコア < 0.95)の中央値は38.7%であり、アルゴリズムの堅牢性に広範な制限が存在することが示された。
  • 平均して各xAIアルゴリズムは12.3テスト(±5)に合格しており、すべての機能的基準を満たすアルゴリズムは存在せず、多くのアルゴリズムが顕著な弱みを有することがわかった。
  • 失敗テストの分布は非対称であるため、中央値が平均よりも代表的であるとされ、失敗パターンがアルゴリズム間で均等に分布していないことを示唆している。
  • ベンチマークは、一部のxAIアルゴリズムが性能においてほぼ同等であることを特定し、実務者が冗長な選択肢を素早く除外し、高性能で理解度の高いツールに集中できるようにした。
  • インタラクティブなUIにより、ユーザーはアルゴリズムの限界を素早く特定でき、特に非専門家ユーザーの誤解や誤用のリスクが低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。