[論文レビュー] Validation of a deep learning mammography model in a population with low screening rates
本研究は、米国および英国のデータで訓練された深層学習マンモグラフィー・モデルを、スクリーニング頻度が低い中国の人口に適用し、腫瘍サイズをマッチングさせた結果、AUROC 0.93 および 0.90 を示し、強固な一般化性能を確認した。さらに、分散に基づく不確実性フィルタリング手法を提案し、曖昧な症例を放射線科医に譲渡することで性能向上を達成した。
A key promise of AI applications in healthcare is in increasing access to quality medical care in under-served populations and emerging markets. However, deep learning models are often only trained on data from advantaged populations that have the infrastructure and resources required for large-scale data collection. In this paper, we aim to empirically investigate the potential impact of such biases on breast cancer detection in mammograms. We specifically explore how a deep learning algorithm trained on screening mammograms from the US and UK generalizes to mammograms collected at a hospital in China, where screening is not widely implemented. For the evaluation, we use a top-scoring model developed for the Digital Mammography DREAM Challenge. Despite the change in institution and population composition, we find that the model generalizes well, exhibiting similar performance to that achieved in the DREAM Challenge, even when controlling for tumor size. We also illustrate a simple but effective method for filtering predictions based on model variance, which can be particularly useful for deployment in new settings. While there are many components in developing a clinically effective system, these results represent a promising step towards increasing access to life-saving screening mammography in populations where screening rates are currently low.
研究の動機と目的
- 米国および英国のデータで訓練された最先端の深層学習マンモグラフィー・モデルが、中国の低スクリーニング人口に一般化するかどうかを評価すること。
- スクリーニングインfraが限られた実臨床環境において、乳腺密度および腫瘍サイズの異なる条件下でのモデル性能を評価すること。
- 新規展開環境における予測の不確実性を特定する実用的指標として、モデルアンサンブル分散の有効性を調査すること。
- 高い感度と特異度を備えたスクリーニングワークフローのシミュレーションを通じて、低リソース環境におけるAIを用いたトリアージの可能性を検討すること。
提案手法
- モデルは二段階のプロセスで訓練された:まず、DDSMおよびOptimamデータセットのピクチャーレベルのデータをMobileNetアーキテクチャを用いて学習し、その後、フルマンモグラム画像に対してエンドツーエンドでファインチューニングした。
- 3つのモデルからなるアンサンブルを用い、垂直方向の画像反転および視野(CCおよびMLO)ごとの予測を平均化し、側別スコアは両側の最大値から導出した。
- モデルの不確実性は、3つのモデルと2つの画像方向における予測スコアの分散として定量化され、高分散ケースのフィルタリング基準として用いられた。
- 性能評価は、中国の2,533例から成るデータセットを用い、腫瘍サイズ、乳腺密度、病変タイプごとのサブグループ分析を実施した。
- 米国の腫瘍サイズ分布を再現し、DREAMチャレンジの結果と公平に比較可能にするために、ブートストラップリサンプリング手法を適用した。
実験結果
リサーチクエスチョン
- RQ1米国および英国の高リソース集団のデータで訓練された深層学習マンモグラフィー・モデルは、中国の低スクリーニング集団に効果的に一般化できるか?
- RQ2実臨床環境において、腫瘍サイズおよび乳腺密度の異なるカテゴリーで、モデル性能はどのように変化するか?
- RQ3モデルアンサンブル分散は、新規展開環境における臨床的トリアージを支援する予測不確実性の信頼できる代理指標として機能するか?
- RQ4高分散予測をフィルタリングすることで、新規集団における全体的な診断性能はどの程度向上するか?
主な発見
- 本モデルは中国データセットにおける乳腺レベルのがん検出で、AUROC 0.93 ± 0.01 を達成し、元のDREAMチャレンジの性能に非常に近い結果を示した。
- ブートストラップシミュレーションによる腫瘍サイズの制御後も、モデルはAUROC 0.90 ± 0.03を維持した。これは、人口統計的および画像的差異を考慮しても、強力な一般化性能を示していることを示している。
- 密度が強い乳腺ではやや低い性能(AUROC 0.914)を示したが、非密度乳腺(AUROC 0.946)に比べ、DREAMチャレンジの結果と一貫していた。
- 高不確実性スコアのケースを除外することでAUROCが向上し、特に不確実性上位40%をフィルタリングした際に最も顕著な向上が観察された。
- 良性症例の平均でモデル分散が最も高く、次いで正常例、悪性例の順であった。これは、良性病変がモデルにとって一貫した分類が難しいことを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。