Skip to main content
QUICK REVIEW

[論文レビュー] Global Saliency: Aggregating Saliency Maps to Assess Dataset Artefact Bias

Jacob Pfau, Albert T. Young|arXiv (Cornell University)|Oct 16, 2019
Explainable Artificial Intelligence (XAI)被引用数 7
ひとこと要約

本稿では、セマンティックセグメンテーションマスクを用いてデータセット全体のセマンティックマップを集約するグローバルサリエンシーを導入し、深層学習モデルにおけるアーティファクト由来のバイアスを定量的に評価する手法を提示する。実験により、バイアスのあるデータで学習されたモデルが黒色インクのマークに対して不釣り合いに高いサリエンシーを割り当てる傾向があることが示され、このバイアスを低減するためのサンプリング戦略を提案する。

ABSTRACT

In high-stakes applications of machine learning models, interpretability methods provide guarantees that models are right for the right reasons. In medical imaging, saliency maps have become the standard tool for determining whether a neural model has learned relevant robust features, rather than artefactual noise. However, saliency maps are limited to local model explanation because they interpret predictions on an image-by-image basis. We propose aggregating saliency globally, using semantic segmentation masks, to provide quantitative measures of model bias across a dataset. To evaluate global saliency methods, we propose two metrics for quantifying the validity of saliency explanations. We apply the global saliency method to skin lesion diagnosis to determine the effect of artefacts, such as ink, on model bias.

研究の動機と目的

  • 皮膚腫瘍診断におけるインクマークなどの視覚的アーティファクトに対するモデルバイアスを、データセット全体で定量的に評価する手法の不足に応えること。
  • 個々の画像におけるサリエンシー解釈を越えて、データセット全体におけるモデル行動のグローバルかつ比較可能な分析を可能にする手法を開発すること。
  • 特に交絡要因となるアーティファクトが存在する状況下でも、サリエンシーがモデルの意思決定を真正に反映しているかを評価すること。
  • アーティファクトとラベルの共起確率を等しくするサンプリング戦略を提案し、アーティファクトバイアスを低減すること。

提案手法

  • セマンティックセグメンテーションマスクを用いて、各クラスごとにアーティファクト領域(例:インク)における平均またはピークサリエンシーを計算する。
  • グローバルサリエンシーを、検証セット全体のアーティファクトピクセルにおける平均サリエンシーと定義し、特定のサリエンシー手法の完全性特性を用いて総サリエンシーで正規化する。
  • 2つの指標を導入する:モデル失敗予測(インクサリエンシーと精度低下の相関)およびデータセットバイアス検出(インクサリエンシーのクラス間分散)。
  • インク-クラス共起確率が異なる3つのトレーニングデータセットを用いる:ベースライン(実世界のバイアス)、アンバイアス(共起確率が等しい)、インクのみ(アーティファクトのみ)でバイアス効果を隔離する。
  • grad-CAMおよび競合勾配×入力サリエンシー法を適用し、その実験的完全性特性を活用してサリエンシー合計を正規化する。
  • 検証セットのインクサリエンシー閾値を満たすサブセットに対してモデル性能を評価し、サリエンシーと予測精度の相関関係を分析する。

実験結果

リサーチクエスチョン

  • RQ1サリエンシーは、単にフォアグラウンド特徴にとどまらず、データセット全体でインクマークなどのアーティファクトに対するモデルの真正の依存度をどの程度反映しているか?
  • RQ2皮膚腫瘍分類における、アーティファクト由来バイアスは、異なる診断クラス間でどのように変動するか?
  • RQ3グローバルサリエンシー指標は、バイアスを検出し、定量的に評価することで、モデル間比較やモデル選択を可能にするか?
  • RQ4サンプリングによってアーティファクトとラベルの共起バイアスを低減することで、アーティファクトサリエンシーが有意に低下し、モデルの頑健性が向上するか?

主な発見

  • ベースラインモデルは、メラノーマ(MEL)および脂漏性角化症(SK)において、他のクラスと比較してインクマークに対して顕著に高いサリエンシーを示した。非MEL+SKクラスとの間に Kendall’s τ = -0.889(p < 0.0001)の相関が観察された。
  • MEL+SK病変では、過剰なインクサリエンシーが高いモデル精度と相関しており、インクを診断的根拠として誤って依存しているが、これは誤ったが有害な依存であることを示している。
  • アンバイアストレーニングデータセットを用いることで、インクサリエンシーのクラス間分散は0.007から0.003に低下したが、この差は統計的に有意ではなかった(Levene検定、W=1.04、p=0.33)。
  • トレーニング中に病変をアブレーションしたモデル( lesion-ablated model)では、精度が28%にとどまり、インクの外観の視覚的ばらつきがバイアスを引き起こすという仮説は裏付けられなかった。
  • グローバルサリエンシーフレームワークは、バイアスのあるデータで学習したモデルが、特にMELおよびSKにおいて診断的関連性をインクに誤って割り当てていることを成功裏に検出できた。
  • ピークサリエンシー集約は、grad-CAMでは平均サリエンシーと類似した結果を示したが、競合サリエンシーではそうではなかった。これは、グローバルバイアス検出における手法依存性の感受性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。