Skip to main content
QUICK REVIEW

[論文レビュー] Disparities in Dermatology AI: Assessments Using Diverse Clinical Images

Roxana Daneshjou, Kailas Vodrahalli|arXiv (Cornell University)|Nov 15, 2021
Cutaneous Melanoma Detection and Management参考文献 15被引用数 12
ひとこと要約

本研究では、病理学的に確認済みで多様な肌色と稀な疾患を含む、Diverse Dermatology Images (DDI) データセットを紹介する。このデータセットを用いた評価により、最先端のモデルがDDIで29–40%のAUC-ROC低下を示し、特に濃い肌色(Fitzpatrick V–VI)と希少疾患において顕著な性能差が生じることが明らかになった。また、多様な訓練データがなければ、強靭な訓練手法ですら効果を発揮しないことが示され、現在のAI皮膚科ツールに深刻なバイアスが存在することが露呈された。

ABSTRACT

More than 3 billion people lack access to care for skin disease. AI diagnostic tools may aid in early skin cancer detection; however most models have not been assessed on images of diverse skin tones or uncommon diseases. To address this, we curated the Diverse Dermatology Images (DDI) dataset - the first publicly available, pathologically confirmed images featuring diverse skin tones. We show that state-of-the-art dermatology AI models perform substantially worse on DDI, with ROC-AUC dropping 29-40 percent compared to the models' original results. We find that dark skin tones and uncommon diseases, which are well represented in the DDI dataset, lead to performance drop-offs. Additionally, we show that state-of-the-art robust training methods cannot correct for these biases without diverse training data. Our findings identify important weaknesses and biases in dermatology AI that need to be addressed to ensure reliable application to diverse patients and across all disease.

研究の動機と目的

  • AIの訓練およびテストデータセットにおける多様で病理学的に確認済みの皮膚科画像の不足に対処すること。
  • 最先端の皮膚科AIモデルが、多様な肌色と希少疾患を反映する画像上でどのように性能を発揮するかを評価すること。
  • 強靭な訓練手法(GroupDRO、CORAL、CDANNなど)が、肌色や疾患のレアリティに起因する性能差を是正できるかどうかを調査すること。
  • モデルバイアスがアルゴリズム設計の問題に起因するのではなく、訓練データの分布に起因することを示すこと。
  • 公平で汎用性のある皮膚科AI開発のための公開可能なベンチマークデータセット(DDI)を確立すること。

提案手法

  • 2010–2020年のスタンフォード病理解剖報告書から、病理学的に確認済みの診断とFitzpatrick肌色タイプ(FST)I–VIのラベルを含む、Diverse Dermatology Images(DDI)データセットを収集した。
  • 肌色の軽い(FST I–II)と濃い(FST V–VI)グループのバランスの取れた代表を確保し、希少疾患(発症率 <1/10,000)も含めた。
  • 標準的な指標(AUC-ROC、感度など)を用いて、3つの事前学習済み皮膚科AIモデル(ModelDerm、DeepDerm、HAM10000)をDDIデータセットで評価した。
  • 肌色グループの代替データセットプロキシを用いて、DeepDermに強靭な訓練手法(GroupDRO、CORAL、CDANN)を適用し、バイアス是正の有効性を検証した。
  • 肌色と疾患の希少度に応じた層別分析を実施し、性能低下要因を特定した。
  • 訓練データからのオリジナルのモデル閾値を用いて、過学習を避け、実世界の展開を模倣した。

実験結果

リサーチクエスチョン

  • RQ1最先端の皮膚科AIモデルは、肌色が多様で希少疾患を含む病理学的に確認済みのデータセット上で、どのように性能を発揮するか?
  • RQ2肌色(Fitzpatrick I–II 対 V–VI)と疾患の希少度は、皮膚科AIモデルの性能差にどの程度寄与しているか?
  • RQ3GroupDRO、CORAL、CDANNなどの強靭な訓練手法は、多様な訓練データがなければ、性能差を是正できるか?
  • RQ4特に一般的な疾患から希少疾患への分布シフトが、モデルの汎化性能にどのように影響するか?
  • RQ5オリジナルのテストセットでのモデル性能指標は、実世界の多様な臨床データにどの程度一般化可能か?

主な発見

  • 最先端の皮膚科AIモデルは、オリジナルの報告値と比較してDDIデータセット評価でAUC-ROCが29–40%低下した。
  • ModelDermはFitzpatrick I–IIで感度0.41、Fitzpatrick V–VIで0.12(p = 0.0025)を示し、濃い肌色での顕著な性能差を示した。
  • DeepDermはFitz I–IIで感度0.69、Fitz V–VIで0.23に低下し、統計的に有意なp値(5.65 × 10⁻⁶)を示した。
  • HAM10000は、自身のテストセットで0.68の感度を示したが、DDI全般では感度が0.04にとどまり、閾値の一般化が不十分であることが示された。
  • 強靭な訓練手法(GroupDRO、CORAL、CDANN)を適用しても、肌色間での公平性に改善が見られず、多様な訓練データの欠如こそが根本原因であることが示された。
  • 希少疾患を除くDDIの一般的な疾患における性能は、オリジナルのテストセットの性能を下回り続け、DeepDermはFitz I–IIとV–VIで感度に顕著な差(0.71 対 0.31、p = 0.007)を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。