[論文レビュー] DeepRadiologyNet: Radiologist Level Pathology Detection in CT Head Images
DeepRadiologyNetは、3.500万枚のCT頭部画像(24,000件のスキャンから収集)を用いて訓練された深層学習システムであり、高信頼度のスキャンにおいて臨床的に有意な病変を検出する際の誤り率が0.0367%にとどまり、米国ボード資格を持つ放射線科医の推定誤り率0.82%を著しく下回る。29,925件の独立したスキャンで480万枚の画像を用いて検証されたモデルは、再訓練されたCNNアーキテクチャと信頼度ベースのスキャン選択手法を用い、優れた正確性で最大42.1%の症例について自動レポートを実現する。
We describe a system to automatically filter clinically significant findings from computerized tomography (CT) head scans, operating at performance levels exceeding that of practicing radiologists. Our system, named DeepRadiologyNet, builds on top of deep convolutional neural networks (CNNs) trained using approximately 3.5 million CT head images gathered from over 24,000 studies taken from January 1, 2015 to August 31, 2015 and January 1, 2016 to April 30 2016 in over 80 clinical sites. For our initial system, we identified 30 phenomenological traits to be recognized in the CT scans. To test the system, we designed a clinical trial using over 4.8 million CT head images (29,925 studies), completely disjoint from the training and validation set, interpreted by 35 US Board Certified radiologists with specialized CT head experience. We measured clinically significant error rates to ascertain whether the performance of DeepRadiologyNet was comparable to or better than that of US Board Certified radiologists. DeepRadiologyNet achieved a clinically significant miss rate of 0.0367% on automatically selected high-confidence studies. Thus, DeepRadiologyNet enables significant reduction in the workload of human radiologists by automatically filtering studies and reporting on the high-confidence ones at an operating point well below the literal error rate for US Board Certified radiologists, estimated at 0.82%.
研究の動機と目的
- 人間の放射線科医を上回る性能で、CT頭部画像における臨床的に有意な病変を自動検出するシステムを開発すること。
- 高信頼度のスキャンを自動的に特定・レポートすることで、放射線科医の診断作業負荷を軽減すること。
- 米国ボード資格を持つ放射線科医を基準として、大規模で独立した臨床試験を用いてシステムの信頼性を評価すること。
- 大規模かつ専門家がアノテートしたデータを活用することで、深層学習モデルが医学画像分野で優れた正確性を達成できることを示すこと。
- 放射線科医の数が限られる環境においても、スケーラブルでコスト効率が良く、世界中に展開可能な診断支援を可能にすること。
提案手法
- 80の臨床施設で収集された24,000件以上のスキャンから約350万枚のCT頭部画像を用いて、深層畳み込みニューラルネットワーク(CNN)を訓練した。
- 自然画像とは異なる統計的性質を示すCT画像に適合させるために、最先端のCNNアーキテクチャを見直し、再設計した。
- ラベル分布の不確実性推定に基づき、モデルがどのスキャンをレポートするかを決定する信頼度ベースの選択メカニズムを採用した。
- ネットワーク出力分布から導かれる事後確率スコアを用いて、個々の画像予測をスキャン単位で統合した。
- 訓練および検証データセットとは完全に独立した29,925件のスキャンと480万枚の画像を用いた臨床試験で性能を評価した。
- 臨床的に有意な所見の基準となる真値を確立するために、35名の米国ボード資格を持つ放射線科医によるコンSENSUS読影を実施した。
実験結果
リサーチクエスチョン
- RQ1深層学習システムは、人間の放射線科医を上回る性能で、CT頭部画像における臨床的に有意な病変を検出できるか?
- RQ2大規模で独立したデータセットにおいて、高信頼度で動作する自動化システムの臨床的に有意な見逃し率はどの程度か?
- RQ3自動化システムは、診断正確性を維持または向上させながら、どの程度まで放射線科医の作業負荷を軽減できるか?
- RQ4モデルの信頼度ベースの選択メカニズムは、人間の放射線科医が高品質な診断症例を特定する能力と比較して、どの程度優れているか?
- RQ5生のCTデータで訓練された深層学習モデルは、くも膜下出血や急性虚血性脳梗塞といった深刻な病変を人間の解釈を上回る精度で検出できるか?
主な発見
- DeepRadiologyNetは、高信頼度のスキャンにおいて臨床的に有意な見逃し率(CSMR)が0.0367%にとどまり、米国ボード資格を持つ放射線科医の推定CSMR(0.82%)を著しく下回った。
- 保守的な動作条件下でも、システムは8.5%のスキャンをレポートし、CSMRが0.037%にとどまり、人間の誤り率をはるかに下回る性能を示した。
- 信頼度ベースのレポート率が42.1%に達した一方で、CSMRは人間の誤り率を下回り、優れた性能を維持した。
- モデルは、急性くも膜下出血や陥没性頭蓋骨骨折を含む、30の排他的でない病理的特徴を正確に同定・局在化した。
- システムの信頼度ベースの選択メカニズムは、真値のアクセスを必要とせず、低信頼度の症例を自動的に人間のレビュー向けにフィルタリングし、安全性を確保した。
- 結果から、深層学習モデルが、特に時間的に敏感で臨床的に重要な病変を検出する分野において、人間の性能に達するか、それを上回るよう訓練可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。