[論文レビュー] Breast density classification with deep convolutional neural networks
本論文は、20万件を超えるスクリーニングマンモグラフィー検査からなる大規模で臨床的に現実的なデータセットを用いて、自動的乳腺密度分類を目的とした深層畳み込みニューラルネットワーク(CNN)を提案する。マルチビューのマンモグラムを用いて訓練されたモデルは、人間の放射線科医と同等の性能を達成し、熟練者による読影と高い一致を示し、主観的な放射線科的評価の再現性があり定量的な代替手段を提供する。
Breast density classification is an essential part of breast cancer screening. Although a lot of prior work considered this problem as a task for learning algorithms, to our knowledge, all of them used small and not clinically realistic data both for training and evaluation of their models. In this work, we explore the limits of this task with a data set coming from over 200,000 breast cancer screening exams. We use this data to train and evaluate a strong convolutional neural network classifier. In a reader study, we find that our model can perform this task comparably to a human expert.
研究の動機と目的
- 従来の手作業による特徴抽出手法を上回る、エンドツーエンドの深層学習モデルを用いた乳腺密度分類の開発を目的とする。
- 20万件を超えるスクリーニングマンモグラフィー検査からなる大規模で臨床的に現実的なデータセット上で、モデルの性能を評価することを目的とする。
- モデルの分類精度と、経験年数の異なる放射線科医を含む人間の専門家との一致度を比較することを目的とする。
- 高解像度でマルチビューのマンモグラムを用いた深層学習を用いた自動乳腺密度評価のベンチマークを確立することを目的とする。
- 深層学習モデルが臨床的に関連性のある環境で、人間の専門家と同等の性能を達成できることを示すこと
提案手法
- モデルは、Simonyanらの研究にインspiredされたマルチカラムの深層畳み込みニューラルネットワークアーキテクチャを採用し、4クラスの乳腺密度分類に適応したものである。
- 入力は、4つの標準的マンモグラフィー視野(L-CC、R-CC、L-MLO、R-MLO)で構成され、それぞれ2600×2000ピクセルの解像度を持つ。
- ネットワークはバッチ正規化、ReLU活性化関数、および4つの密度カテゴリに対応する4ユニットのソフトマックス出力層を採用している。
- 比較のため、10~20ビンの画素強度ヒストグラムとソフトマックス回帰を用いたベースラインモデルを、100ユニットの隠れ層を有する・なしの両状態で訓練した。
- データセットは訓練用、検証用、テスト用に分割され、訓練データの10%が早期停止およびモデル選択に使用された。
- 性能評価には、マクロ平均AUC(macAUC)、トップ1、トップ2、トップ3の正解率、および密度(dense)対非密度(not dense)のスーパーカテゴリ分類が用いられた。
実験結果
リサーチクエスチョン
- RQ1マルチビューのマンモグラムから乳腺密度を分類する際、深層畳み込みニューラルネットワークは人間の放射線科医と同等の性能を達成できるか?
- RQ2大規模で臨床的に現実的なデータセット上で、深層学習モデルの性能は従来のヒストグラムベースの分類器と比べてどうか?
- RQ3読影者研究において、深層学習モデルは熟練者による読影と、ゴールドスタンダードのラベルとどの程度の一致度を示すか?
- RQ4密度対非密度のスーパーカテゴリ分類において、モデルの性能は人間の性能を上回るか、または同等か?
- RQ5高解像度のマンモグラムの大規模データセットで訓練された深層学習モデルは、主観的な放射線科的評価の再現性があり定量的な代替手段を提供できるか?
主な発見
- 最良の深層CNNモデルは、マクロ平均AUC(macAUC)0.934を達成し、人間の専門家が達成した0.892のmacAUCを上回った。
- 4クラス分類タスクにおいて、トップ1正解率69.4%、トップ2正解率90.8%、トップ3正解率99.2%を達成した。
- 密度対非密度のスーパーカテゴリ分類において、モデルは82.5%の正解率を達成し、人間専門家の平均75.8%を上回った。
- Cohenのカッパ係数は、モデルとゴールドスタンダードラベルとの一致度(kappa = 0.61)が、熟練者間の一致度(kappa = 0.55~0.65)と同等であることを示した。
- 読影者研究により、モデルの性能が経験豊富な放射線科医と同等であり、複数の熟練者による評価において高い一貫性を示したことが確認された。
- 本研究は、大規模で現実世界のデータセットで訓練された深層学習モデルが、乳腺密度分類において人間の水準の性能を達成でき、主観的評価の再現性があり定量的な代替手段を提供できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。