Skip to main content
QUICK REVIEW

[論文レビュー] SCREENet: A Multi-view Deep Convolutional Neural Network for Classification of High-resolution Synthetic Mammographic Screening Scans

Saeed Seyyedi, Margaret J. Wong|arXiv (Cornell University)|Sep 18, 2020
AI in cancer detection参考文献 26被引用数 8
ひとこと要約

SCREENet は、ダウンサンプリングを行わず、デジタル乳房トモサインティグラフィ(DBT)から得られる高解像度の合成マンモグラムを BI-RADS カテゴリーに分類するマルチビュー深層畳み込みニューラルネットワーク(MV-CNN)である。BI-RADS 0(正常)と非 BI-RADS 0(異常または追加評価が必要)を区別する際の AUC は 0.912 を達成したが、小規模なデータセットや低解像度画像で学習した場合、性能が著しく低下した。

ABSTRACT

Purpose: To develop and evaluate the accuracy of a multi-view deep learning approach to the analysis of high-resolution synthetic mammograms from digital breast tomosynthesis screening cases, and to assess the effect on accuracy of image resolution and training set size. Materials and Methods: In a retrospective study, 21,264 screening digital breast tomosynthesis (DBT) exams obtained at our institution were collected along with associated radiology reports. The 2D synthetic mammographic images from these exams, with varying resolutions and data set sizes, were used to train a multi-view deep convolutional neural network (MV-CNN) to classify screening images into BI-RADS classes (BI-RADS 0, 1 and 2) before evaluation on a held-out set of exams. Results: Area under the receiver operating characteristic curve (AUC) for BI-RADS 0 vs non-BI-RADS 0 class was 0.912 for the MV-CNN trained on the full dataset. The model obtained accuracy of 84.8%, recall of 95.9% and precision of 95.0%. This AUC value decreased when the same model was trained with 50% and 25% of images (AUC = 0.877, P=0.010 and 0.834, P=0.009 respectively). Also, the performance dropped when the same model was trained using images that were under-sampled by 1/2 and 1/4 (AUC = 0.870, P=0.011 and 0.813, P=0.009 respectively). Conclusion: This deep learning model classified high-resolution synthetic mammography scans into normal vs needing further workup using tens of thousands of high-resolution images. Smaller training data sets and lower resolution images both caused significant decrease in performance.

研究の動機と目的

  • 高解像度の合成マンモグラムをデジタル乳房トモサインティグラフィ(DBT)から BI-RADS カテゴリーに分類する深層学習モデルの開発。
  • 画像解像度および学習データセットサイズがモデル性能に与える影響の評価。
  • ダウンサンプリングや手動によるパrameterチューニングなしに、フル解像度画像を処理するエンドツーエンドのマルチビュー深層学習システムの構築。
  • 放射線科医の支援を目的とし、スクリーニング画像の正常対追加評価が必要なケースの自動分類。
  • 数万枚の高解像度 DBT 画像を用いた、堅牢な分類モデルの学習の可能性の評価。

提案手法

  • 21,264 件の DBT スクリーニング検査から得た 82,943 枚の高解像度の合成 2D マンモグラムを用いて、マルチビュー畳み込みニューラルネットワーク(MV-CNN)を学習。
  • 頭尾視野(CC)および側頭視野(MLO)を個別に処理し、分類のための統合を実行するマルチビューアーキテクチャを採用。
  • 学習中に元の画像解像度を維持し、微細な解剖的特徴を損なわないようにした。
  • グローバル平均プーリングとソフトマックス分類を適用し、各症例を BI-RADS 0、1、2 クラスに割り当てた。
  • ホールドアウトテストセットを用いて、受信者リポーチ曲線下積分(AUC)、正解率、再現率、適合率を用いてモデル性能を評価。
  • アブレーションスタディとして、学習データセットサイズ(25%、50%)と画像解像度(1/4×、1/2×)を段階的に低くすることで、モデルのロバストネスを評価。

実験結果

リサーチクエスチョン

  • RQ1マルチビュー深層畳み込みニューラルネットワークは、DBT から得られる高解像度の合成マンモグラムを BI-RADS カテゴリーに分類する際に高い性能を達成できるか?
  • RQ2学習データセットサイズを小さくすると、モデルの分類性能にどのような影響が生じるか?
  • RQ3画像解像度が、正常と異常のスクリーニング症例を区別するモデルの能力に与える影響は何か?
  • RQ4ダウンサンプリングやユーザー定義パrameterなしに、モデルは高い性能を維持できるか?
  • RQ5AUC、再現率、適合率の観点から、モデルの予測結果は放射線科医の評価と比較してどうなるか?

主な発見

  • MV-CNN は、BI-RADS 0(正常)と非 BI-RADS 0(異常または追加評価が必要)を分類する際、AUC 0.912 を達成し、正解率 84.8%、再現率 95.9%、適合率 95.0% を示した。
  • 学習データセットを 50% に縮小した場合、AUC は著しく 0.877(p=0.010)に低下し、25% に縮小した場合も AUC=0.834(p=0.009)に低下した。これは、データ量に強く依存していることを示している。
  • 画像を 1/2 解像度にダウンサンプリングした場合、AUC は 0.870(p=0.011)に低下し、1/4 解像度にした場合も AUC=0.813(p=0.009)に低下した。解像度への感受性が示された。
  • ダウンサンプリングにより特徴マップのサイズが畳み込みカーネルサイズより小さくなり、層がスキップされることが原因で性能劣化が生じた。
  • モデルのサリエンシーマップは、異常例において予測に寄与した領域を明確に特定しており、解釈可能性を裏付けた。
  • 本研究では、高性能を達成するには数万枚の高解像度画像が必要であり、データサイズと解像度が両方とも重要な要因であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。