Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Deep Neural Networks Trained on Clinical Images in Dermatology with the Fitzpatrick 17k Dataset

Matthew Groh, Caleb Harris|arXiv (Cornell University)|Apr 20, 2021
Cutaneous Melanoma Detection and Management被引用数 7
ひとこと要約

本稿では、深層ニューラルネットワークの肌色ごとの性能を評価するために、16,577枚の臨床皮膚科画像にフィッツパトリック皮膚タイプのラベルを付与した Fitzpatrick 17k データセットを紹介する。主に明るい肌色の画像で訓練されたモデルは、暗い肌色の画像では顕著に低い正確性を示し、データセットバイアスに起因するAIを用いた皮膚科診断における重要な格差が明らかになった。

ABSTRACT

How does the accuracy of deep neural network models trained to classify clinical images of skin conditions vary across skin color? While recent studies demonstrate computer vision models can serve as a useful decision support tool in healthcare and provide dermatologist-level classification on a number of specific tasks, darker skin is underrepresented in the data. Most publicly available data sets do not include Fitzpatrick skin type labels. We annotate 16,577 clinical images sourced from two dermatology atlases with Fitzpatrick skin type labels and open-source these annotations. Based on these labels, we find that there are significantly more images of light skin types than dark skin types in this dataset. We train a deep neural network model to classify 114 skin conditions and find that the model is most accurate on skin types similar to those it was trained on. In addition, we evaluate how an algorithmic approach to identifying skin tones, individual typology angle, compares with Fitzpatrick skin type labels annotated by a team of human labelers.

研究の動機と目的

  • 公的皮膚科画像データセットにおいて、特に代表されていない暗い肌色の皮膚タイプラベルの欠如に対処すること。
  • 新たにラベル付けされたデータセットを用いて、フィッツパトリック皮膚タイプごとの皮膚疾患分類におけるモデルの正確性の違いを調査すること。
  • 人間によるラベル付けされたフィッツパトリック皮膚タイプラベルと、個別タイプ角(ITA)を用いた自動皮膚色推定との比較。
  • 不均衡な皮膚科画像データで訓練された深層学習モデルにおける正確性の格差を特定および定量すること。
  • 肌色のサブグループごとのバイアスの実証的評価を可能にすることで、AI駆動皮膚科分野における公平性と透明性を促進すること。

提案手法

  • 2つのオープンアクセスアトラス(DermaAmin および Atlas Dermatologico)から得た16,577枚の臨床皮膚科画像を、人間のラベル付け者チームによる作業でフィッツパトリック皮膚タイプラベルにラベル付けした。
  • ImageNetで事前学習されたVGG-16アーキテクチャを微調整した深層ニューラルネットワークを、画像データのみを用いて114種類の皮膚疾患を分類するように訓練した。
  • 訓練データの分布に基づいて、フィッツパトリック皮膚タイプごとのモデル性能を評価し、正確性の格差を測定した。
  • RGB値からITAを計算した。式は:$ ITA = \tan^{-1} \left( \frac{B - Y}{R - Y} \right) \times \frac{180}{\pi} $、ここでR, G, BはRGB値、Yは輝度である。
  • ITAスコアを2つのしきい値設定法(Kinyanjuiら(2017)と経験的に導出したもの(式15))を用いてフィッツパトリック皮膚タイプにマッピングした。
  • 2名の board-certified dermatologists がランダムに選択された3%(504枚)の画像を評価するデータ品質チェックを実施し、標準ベンチマークと整合する3.4%の誤差率を確認した。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークによる皮膚科画像分類の正確性は、異なるフィッツパトリック皮膚タイプでどのように変化するか?
  • RQ2トレーニングデータセットにおけるデータの不均衡が、軽い肌色タイプに偏向したモデル性能をどの程度引き起こすか?
  • RQ3個別タイプ角(ITA)アルゴリズムは、多様な肌色において、人間によるラベル付けされたフィッツパトリック皮膚タイプラベルとどの程度一致するか?
  • RQ4臨床皮膚科画像において、IT Aベースの皮膚色推定の実証的誤差率は、専門家によるラベル付けと比較してどの程度か?
  • RQ5Fitzpatrick 17k データセットは、皮膚科分野におけるAIモデルの公平性とバイアスを評価するベンチマークとして機能できるか?

主な発見

  • Fitzpatrick 17k データセットには16,577枚の臨床画像が含まれており、フィッツパトリック皮膚タイプ1および2の画像がタイプ5および6の画像よりも3.6倍多い。これは、暗い肌色タイプの顕著な不足を示している。
  • 深層ニューラルネットワークモデルは皮膚疾患分類において高い正確性を達成したが、暗いフィッツパトリック皮膚タイプでは顕著に低い性能を示し、タイプ5および6ではタイプ1および2と比較して正確性が著しく低下した。
  • 人間によるラベル付けされたフィッツパトリック皮膚タイプラベルとITAスコアの一致度は、Kinyanjuiのしきい値を用いると45.87%〜78.21%、経験的しきい値を用いると60.34%〜82.26%であった。これは、自動皮膚色推定に著しい誤差があることを示している。
  • 最も正確なITAベースの分類でも、約1/3のデータセットで1つ以上のフィッツパトリックレベルのずれが生じており、皮膚色ラベル付けにITAに依存することは限界があることを示している。
  • モデルの正確性は、トレーニングデータに最も近い皮膚タイプで最も高かった。これは、データ分布がモデルバイアスおよび性能の非均一性に直接影響することを確認している。
  • 本研究は、皮膚科画像コレクションにおけるデータセットバイアスが、特に暗い肌色の患者に不利な影響を及ぼす測定可能な正確性の格差を引き起こすことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。