Skip to main content
QUICK REVIEW

[論文レビュー] Addressing Artificial Intelligence Bias in Retinal Disease Diagnostics

Philippe Burlina, Neil Joshi|arXiv (Cornell University)|Apr 28, 2020
Retinal Imaging and Analysis参考文献 22被引用数 11
ひとこと要約

本研究では、生成対抗ネットワーク(GAN)を用いて、肌の色が濃い被験者や糖尿病性網膜症で紹介を要する被験者といった、代表されないサブグループの合成網膜画像を生成することを提案する。これにより、データの不均衡やドメインシフトに起因するAIバイアスを軽減する。この手法により、肌の色が薄い者と濃い者の間での性能差が12.5%からわずか0.5%にまで低下し、両グループの正確性はほぼ同一(72.0% 対 71.5%)に達した。

ABSTRACT

This study evaluated generative methods to potentially mitigate AI bias when diagnosing diabetic retinopathy (DR) resulting from training data imbalance, or domain generalization which occurs when deep learning systems (DLS) face concepts at test/inference time they were not initially trained on. The public domain Kaggle-EyePACS dataset (88,692 fundi and 44,346 individuals, originally diverse for ethnicity) was modified by adding clinician-annotated labels and constructing an artificial scenario of data imbalance and domain generalization by disallowing training (but not testing) exemplars for images of retinas with DR warranting referral (DR-referable) and from darker-skin individuals, who presumably have greater concentration of melanin within uveal melanocytes, on average, contributing to retinal image pigmentation. A traditional/baseline diagnostic DLS was compared against new DLSs that would use training data augmented via generative models for debiasing. Accuracy (95% confidence intervals [CI]) of the baseline diagnostics DLS for fundus images of lighter-skin individuals was 73.0% (66.9%, 79.2%) vs. darker-skin of 60.5% (53.5%, 67.3%), demonstrating bias/disparity (delta=12.5%) (Welch t-test t=2.670, P=.008) in AI performance across protected subpopulations. Using novel generative methods for addressing missing subpopulation training data (DR-referable darker-skin) achieved instead accuracy, for lighter-skin, of 72.0% (65.8%, 78.2%), and for darker-skin, of 71.5% (65.2%,77.8%), demonstrating closer parity (delta=0.5%) in accuracy across subpopulations (Welch t-test t=0.111, P=.912). Findings illustrate how data imbalance and domain generalization can lead to disparity of accuracy across subpopulations, and show that novel generative methods of synthetic fundus images may play a role for debiasing AI.

研究の動機と目的

  • データの不均衡とドメイン一般化が、網膜疾患診断におけるAIバイアスにどのように寄与するかを調査すること。
  • 生成的データ拡張が、肌の色が濃い者といった保護されるべきサブグループ間での性能差を軽減できるかどうかを評価すること。
  • 合成データ生成が、網膜症検出における肌の色が薄い者と濃い者の間の正確性のギャップを埋められることを実証すること。
  • トレーニングデータに十分に代表されていないサブグループに対してテストを実施した場合、ドメインシフトがAIモデルの性能に与える影響を評価すること。
  • 代表されていないグループのための合成データを用いた、医療画像AIにおけるバイアス除去フレームワークを提供すること。

提案手法

  • 研究者たちは、データの不均衡とドメインシフトを模倣するために、公に提供されているKaggle-EyePACSデータセットから、肌の色が濃い被験者のDR参照症例のトレーニング例を削除した。
  • 不均衡なデータセット上でベースラインディープラーニングシステム(DLS)を訓練し、肌の色ごとの性能ベンチマークを確立した。
  • 新規の生成モデル(GANベース)を、肌の色が濃い被験者のDR参照症例のリアルな後庭画像を合成するように訓練した。
  • 合成画像を用いて、2番目のDLSのトレーニングデータを拡張し、公平性と正確性について評価した。
  • 肌の色サブグループごとの正確性と95%信頼区間を用いて、ベースラインモデルと拡張モデルの性能を比較した。
  • 性能差の統計的有意性は、ウェルチのt検定を用いて評価した。

実験結果

リサーチクエスチョン

  • RQ1肌の色によるデータの不均衡が、AIベースの糖尿病性網膜症診断における性能差をどの程度引き起こすか?
  • RQ2生成モデルが、代表されていないサブグループのためのリアルな網膜画像を効果的に合成できるか?
  • RQ3合成データ拡張が、肌の色が薄い者と濃い者の間で診断正確性の公平性を向上させることができるか?
  • RQ4トレーニングデータに十分に代表されていないサブグループに対してテストを実施した場合、ドメイン一般化がAIモデルの性能に与える影響は?
  • RQ5生成手法が、網膜疾患診断におけるサブグループ間の正確性ギャップを埋められるか?

主な発見

  • ベースラインDLSでは、肌の色が薄い者(73.0%)と濃い者(60.5%)の間で12.5%の正確性のギャップが認められ、統計的に有意であった(P = .008)。
  • 肌の色が濃い被験者のDR参照症例について生成的データ拡張を適用した後、正確性のギャップはわずか0.5%にまで縮小された(肌の色が薄い者:72.0% 対 肌の色が濃い者:71.5%)。
  • ウェルチt検定により、拡張後はサブグループ間での性能差に有意差が認められず(P = .912)、ほぼ同等の性能が得られたことが示された。
  • 生成アプローチは、両グループの両方で高い診断正確性を維持しており、95%信頼区間がサブグループ間で重複していた。
  • 結果として、合成データ生成が、網膜診断におけるデータの不均衡やドメインシフトに起因するバイアスを効果的に是正できることを示した。
  • 本研究は、生成モデルが医療AIアプリケーションにおける実用的バイアス除去戦略であるという実証的証拠を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。