Skip to main content
QUICK REVIEW

[論文レビュー] Towards unraveling calibration biases in medical image analysis

María Agustina Ricci Lara, Candelaria Mosquera|arXiv (Cornell University)|May 9, 2023
Cutaneous Melanoma Detection and Management被引用数 5
ひとこと要約

この論文は、皮膚 lesion 分類のための AI モデルにおけるキャリブレーションバイアスを調査し、予測されたキャリブレーション誤差(ECE)などの一般的なキャリブレーション指標が、特に白人系・黒人系皮膚の患者間のサンプルサイズの不均衡によって系統的にバイアスを受けることを明らかにした。研究では、このようなバイアスが誤った公平性評価を引き起こす可能性があることを示し、低リソースなサブグループにおける信頼性の高い公平性監査を確保するため、デルタ・ブライア(Delta-Brier)やデルタ・CE(Delta-CE)などのロバストな指標の使用を提唱している。

ABSTRACT

In recent years the development of artificial intelligence (AI) systems for automated medical image analysis has gained enormous momentum. At the same time, a large body of work has shown that AI systems can systematically and unfairly discriminate against certain populations in various application scenarios. These two facts have motivated the emergence of algorithmic fairness studies in this field. Most research on healthcare algorithmic fairness to date has focused on the assessment of biases in terms of classical discrimination metrics such as AUC and accuracy. Potential biases in terms of model calibration, however, have only recently begun to be evaluated. This is especially important when working with clinical decision support systems, as predictive uncertainty is key for health professionals to optimally evaluate and combine multiple sources of information. In this work we study discrimination and calibration biases in models trained for automatic detection of malignant dermatological conditions from skin lesions images. Importantly, we show how several typically employed calibration metrics are systematically biased with respect to sample sizes, and how this can lead to erroneous fairness analysis if not taken into consideration. This is of particular relevance to fairness studies, where data imbalance results in drastic sample size differences between demographic sub-groups, which, if not taken into account, can act as confounders.

研究の動機と目的

  • 人間の皮膚色のサブグループ間におけるサンプルサイズの不均衡が、医療画像解析におけるキャリブレーション指標の信頼性に与える影響を調査すること。
  • サンプルサイズの不均衡が存在する状況下で、予測されたキャリブレーション誤差(ECE)のような一般的に用いられるキャリブレーション指標が、誤った公平性評価をもたらすかどうかを評価すること。
  • 有限なサンプルサイズに対して感受性が低く、代表されていないグループにおけるより正確な公平性監査に適したキャリブレーション指標を同定すること。
  • 公平性評価におけるモデルのキャリブレーション品質とサンプルサイズバイアスの相互作用を評価すること。
  • 公平な AI を実現するため、包括的なデータセットとロバストなキャリブレーション指標の使用を提唱すること。

提案手法

  • サンプルサイズの不均衡を示す皮膚色サブグループを含む実世界の皮膚科データセットを用いて訓練された皮膚 lesion 分類モデルに対して、複数のキャリブレーション指標(例:ECE、ブライアスコア、デルタ・ブライア、デルタ・CE)を評価した。
  • 制御実験と実データを用いて、白人系と黒人系患者グループ間のサンプルサイズ差に対する各指標の感受性を分析した。
  • PAD-UFES-20 データセット(1,494 枚の画像とフィッツパトリック皮膚タイプのラベルを有する)を用い、人種的サブグループ間での公平性を評価した。
  • サンプルサイズバイアスを軽減するため、ナイーブな指標適用とリサンプリング、ロバストな指標戦略を比較した。
  • 特にモデルの再キャリブレーション後の状況において、モデルのキャリブレーション品質と指標のサンプルサイズ感受性との相互作用を調査した。
  • キャリブレーション指標の二重構造的解釈を提唱した:一つは有限サンプルサイズ効果に起因するもので、もう一つは真のモデルのキャリブレーション外れを反映するものである。
(A)
(A)

実験結果

リサーチクエスチョン

  • RQ1皮膚科画像解析において、人種的サブグループ間で極端なサンプルサイズの不均衡が生じた場合、一般的なキャリブレーション指標はどのように振る舞うか?
  • RQ2有限サンプルサイズ効果の影響により、予測されたキャリブレーション誤差(ECE)のような指標がどれほど誤った公平性結論を導くか?
  • RQ3サンプルサイズの差に対して感受性が低く、低リソースなサブグループにおける公平性監査に適しているキャリブレーション指標は何か?
  • RQ4モデルの再キャリブレーションは、キャリブレーション指標のサンプルサイズバイアス感受性にどのように影響するか?
  • RQ5デルタ・ブライアやデルタ・CEのようなロバストな指標は、不均衡な医療画像データセットにおいてより信頼性の高い公平性評価を提供できるか?

主な発見

  • 予測されたキャリブレーション誤差(ECE)のような一般的なキャリブレーション指標は、サンプルサイズに強く感受性を示し、サンプル数が少ないほど系統的に悪化するため、バイアスを含む公平性評価をもたらす。
  • 研究では、特に再キャリブレーション後の状況において、キャリブレーション指標のバイアスが、キャリブレーションが良好なモデルで顕著に現れることを発見した。この場合、サンプルサイズ効果が支配的である。
  • デルタ・ブライアやデルタ・CEといった指標は、サンプルサイズに対する感受性が低く、代表されていないグループにおける公平性監査により信頼性がある。
  • 判別性能(例:AUC や正答率)に顕著な差がなくても、指標バイアスのため、キャリブレーションの不均衡が生じる可能性がある。これは、実際のモデルバイアスとは無関係である。
  • モデルのキャリブレーション品質とサンプルサイズの相互作用により、指標に二重の挙動が現れる:一つは有限サンプルサイズ効果に起因し、もう一つは真のモデルのキャリブレーション外れを反映する。
  • 特に黒人系皮膚の患者向けのラベル付きデータがオープンデータベースに不足していることが、信頼性のある公平性評価を困難にしている。これにより、包括的なデータセットの必要性が強調された。
(B)
(B)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。