[論文レビュー] Saliency-Bench: A Comprehensive Benchmark for Evaluating Visual Explanations
この論文は、医療画像診断や物体認識などの分野をカバーする、人間がアノテートした説明を備えた8つの多様なデータセットを有する、説明可能AI(XAI)における視覚的説明の評価のための包括的ベンチマーク「Saliency-Bench」を紹介する。このベンチマークは、アライメントベースと因果関係ベースの両方の指標を用いて、標準的かつ定量的な視覚的説明手法の評価を可能にし、Integrated GradientsとRISEがアライメントと忠実度の両面で他を上回ることを明らかにした。
Explainable AI (XAI) has gained significant attention for providing insights into the decision-making processes of deep learning models, particularly for image classification tasks through visual explanations visualized by saliency maps. Despite their success, challenges remain due to the lack of annotated datasets and standardized evaluation pipelines. In this paper, we introduce Saliency-Bench, a novel benchmark suite designed to evaluate visual explanations generated by saliency methods across multiple datasets. We curated, constructed, and annotated eight datasets, each covering diverse tasks such as scene classification, cancer diagnosis, object classification, and action classification, with corresponding ground-truth explanations. The benchmark includes a standardized and unified evaluation pipeline for assessing faithfulness and alignment of the visual explanation, providing a holistic visual explanation performance assessment. We benchmark these eight datasets with widely used saliency methods on different image classifier architectures to evaluate explanation quality. Additionally, we developed an easy-to-use API for automating the evaluation pipeline, from data accessing, and data loading, to result evaluation. The benchmark is available via our website: https://xaidataset.github.io.
研究の動機と目的
- 説明可能AI(XAI)における視覚的説明の評価のための標準的で定量的なベンチマークの不足を解消すること。
- 性別分類、物体検出、医療画像診断などの分野をカバーする、人間がアノテートした説明を備えた8つの多様なデータセットのキュレートされたコレクションを提供すること。
- 統一されたパイプラインとオープンソースAPIを通じて、視覚的説明手法の公平で再現可能かつ包括的な評価を可能にすること。
- 特に医療診断などのハイリスク応用分野において、モデルの忠実度と人間の認識とのギャップを埋めること。
- データローディング、説明生成、評価ワークフローの標準化を通じて、異なる手法間の比較と再現性を促進すること。
提案手法
- ベンチマークは、コンピュータビジョンにおける画像分類タスクをカバーする8つのデータセットを統合しており、各データセットはモデル予測のための人間による説明でアノテートされている。
- 統一された視覚的説明パイプラインを実装し、データローディング、8つの最先端の手法(例:GradCAM、Integrated Gradients、RISE、ViT)による説明生成、および評価をサポートしている。
- 評価フレームワークには、6つのアライメントベースの指標(例:L2、IoU、F1)と2つの因果関係ベースの指標(Insertion、Deletion)が含まれており、説明の質を評価する。
- 人間によるアノテート済みの説明は、きめ細やかな独立ラベリングとコンSENSUS手順を経て収集され、信頼性を確保し、個人のバイアスを低減している。
- 研究者が再現性とアクセシビリティを高められるように、データローディングと評価を簡素化するオープンソースAPIをリリースしている。
- ベンチマークは、後処理型と内在型の両方の説明手法をサポートしており、既存のXAI技術と広く互換性を持つ。

実験結果
リサーチクエスチョン
- RQ1異なる視覚的説明手法は、多様なデータセットにおいて人間がアノテートした説明とどの程度一致しているか?
- RQ2現在の説明手法は、モデルの予測に対する忠実度をどの程度達成しているか、同時に人間の推論とどの程度一致しているか?
- RQ3標準的で定量的な指標は、複数のデータセットと手法において、視覚的説明の質を信頼性を持って区別できるか?
- RQ4アーキテクチャの選択(例:CNN対ViT)は、生成されたサリエンシーマップの解釈可能性とアライメントにどのように影響するか?
- RQ5既存の評価プロトコルの限界は何か?Saliency-Benchはそれらをどのように改善しているか?
主な発見
- Integrated Gradients(IG)は、Cat&Dog-XAIデータセットで0.9974という最高のアライメントスコアを達成し、F1およびIoU指標の両面で他を上回った。
- RISEは、Object-XAIデータセットでF1スコア0.857、IoU 0.5266を記録し、説明マップの空間的精度が非常に高かった。
- ビジョントランスフォーマー(ViT)は、GradCAMのような局所的メソッドとは異なり、複雑で分散的な推論パターンをよりよく捉えた、豊富なマルチレギオンの注目マップを生成した。
- Nodule Classificationデータセットでは、IGとGBP手法が最高のF1スコア(0.472および0.468)を達成し、人間がアノテートしたサリエンシーリージョンと強い一致を示した。
- GradCAMとGradCAM++は、忠実度は高く維持されていたが、アライメントは低かったため、人間の認識とは完全に一致しないモデル関連領域を強調している可能性がある。
- ベンチマークは、画像の出典に差異があるデータセット(例:膵臓腫瘍データセット)では、モデルが腫瘍の位置ではなく画像の出典に依存する可能性のあるバイアスが生じる可能性があることを明らかにした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。