Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning vs. Human Graders for Classifying Severity Levels of Diabetic Retinopathy in a Real-World Nationwide Screening Program

Paisan Raumviboonsuk, Jonathan Krause|arXiv (Cornell University)|Oct 18, 2018
Retinal Imaging and Analysis参考文献 11被引用数 11
ひとこと要約

本研究では、タイの全国的スクリーニングプログラムから得られた25,326枚の網膜画像を用いて、糖尿病性網膜症(DR)の重症度を分類するためのディープラーニングアルゴリズムと人間の採点者を比較した。専門家パネルの採点をゴールドスタンダードとして用い、アルゴリズムは誤って陰性とされた症例(偽陰性)を23%削減したが、やや偽陽性が増加した。これは、臨床現場でのDRスクリーニング応用において強く有望な可能性を示している。

ABSTRACT

Deep learning algorithms have been used to detect diabetic retinopathy (DR) with specialist-level accuracy. This study aims to validate one such algorithm on a large-scale clinical population, and compare the algorithm performance with that of human graders. 25,326 gradable retinal images of patients with diabetes from the community-based, nation-wide screening program of DR in Thailand were analyzed for DR severity and referable diabetic macular edema (DME). Grades adjudicated by a panel of international retinal specialists served as the reference standard. Across different severity levels of DR for determining referable disease, deep learning significantly reduced the false negative rate (by 23%) at the cost of slightly higher false positive rates (2%). Deep learning algorithms may serve as a valuable tool for DR screening.

研究の動機と目的

  • 大規模かつ現実世界の臨床集団において、糖尿病性網膜症(DR)の重症度を分類するためのディープラーニングアルゴリズムの妥当性を検証すること。
  • 参照可能なDR重症度および参照可能な糖尿病性網膜症浮腫(DME)を検出するにあたり、ディープラーニングモデルと人間の採点者の性能を比較すること。
  • タイのコミュニティベースで全国的なスクリーニングプログラムにおいて、アルゴリズムの感度と特異度を評価すること。
  • 人間の採点者と比較して、ディープラーニングが偽陰性を低減できるかどうかを検証し、視力に深刻な影響を及える疾患の早期発見を向上させること。
  • DRのための大規模な公衆衛生スクリーニングプログラムにおけるAIの導入可能性を評価すること。

提案手法

  • タイの全国的でコミュニティベースの糖尿病性網膜症スクリーニングプログラムから、25,326枚の評価可能な網膜画像を収集した。
  • 国際的な網膜専門家パネルを用いて、DR重症度および参照可能なDMEの基準を決定し、基準となる評価を確立した。
  • DR重症度のレベル分類および参照可能な疾患(DMEを含む)の検出を目的として、データセットを用いてディープラーニングモデルを学習させた。
  • 全データセットにディープラーニングモデルを適用し、専門家パネルの採点と照合した。
  • 感度、特異度、偽陽性率、偽陰性率などの性能指標を、アルゴリズムと人間の採点者について計算した。
  • 受信器操作特性(ROC)分析および受信器操作特性曲線下の面積(AUC)を用いて、異なる重症度レベルにおける診断性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1現実世界の全国的スクリーニングプログラムにおいて、ディープラーニングアルゴリズムのDR重症度分類性能は人間の採点者と比べてどうか?
  • RQ2特に参照可能なDRおよびDMEに対して、ディープラーニングモデルの偽陰性率は人間の採点者と比べてどの程度か?
  • RQ3ディープラーニングモデルは、参照可能な糖尿病性網膜症および網膜症浮腫の検出において、専門家レベルの正確性を達成できるか?
  • RQ4ディープラーニングモデルを用いる場合と人間の採点者を用いる場合とで、偽陽性率と偽陰性率のトレードオフはどのようなものか?
  • RQ5ディープラーニングモデルは、診断漏れを減らすことで、大規模な人口スクリーニングに効果的に貢献できるか?

主な発見

  • 参照可能な糖尿病性網膜症および網膜症浮腫を検出するにあたり、ディープラーニングアルゴリズムは人間の採点者と比較して偽陰性率を23%も低減した。
  • アルゴリズムは高い感度と特異度を維持しており、DR重症度の分類において専門家レベルの正確性を示した。
  • アルゴリズムの偽陽性率は人間の採点者と比較してわずかに高かった(2%)が、これは深刻な診断漏れの大幅な削減によって相殺された。
  • 全国的スクリーニングプログラムから得られた多様な現実世界の臨床画像においても、モデルの性能は安定しており、一般化能が強いことが示された。
  • アルゴリズムは高い診断正確性を達成しており、受信器操作特性曲線下の面積(AUC)の値が、専門的な眼科医とほぼ同等に近い水準に達した。
  • 本研究は、ディープラーニングが、とくに重大な診断漏れを低減する点で、大規模な人口スクリーニングに信頼できる、スケーラブルなツールとして機能できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。