Skip to main content
QUICK REVIEW

[論文レビュー] Detection of masses and architectural distortions in digital breast tomosynthesis: a publicly available dataset of 5,060 patients and a deep learning model

Mateusz Buda, Ashirbani Saha|arXiv (Cornell University)|Nov 13, 2020
AI in cancer detection参考文献 19被引用数 9
ひとこと要約

本論文は、放射線科医によるマスおよびアーキテクチャ的歪みのラベル付けが施された、5,060例の患者、22,032例のデジタル乳房トモサインティーズ(DBT)ボリュームを含む、公開可能なデータセットを紹介し、これらの異常を同定するワンフェーズのディープラーニングモデルを提示している。このモデルは、1つの乳房あたり2件の偽陽性を示した際の感度65%を達成し、今後のDBTスクリーニングにおけるAI開発のベンチマークを確立した。

ABSTRACT

Breast cancer screening is one of the most common radiological tasks with over 39 million exams performed each year. While breast cancer screening has been one of the most studied medical imaging applications of artificial intelligence, the development and evaluation of the algorithms are hindered due to the lack of well-annotated large-scale publicly available datasets. This is particularly an issue for digital breast tomosynthesis (DBT) which is a relatively new breast cancer screening modality. We have curated and made publicly available a large-scale dataset of digital breast tomosynthesis images. It contains 22,032 reconstructed DBT volumes belonging to 5,610 studies from 5,060 patients. This included four groups: (1) 5,129 normal studies, (2) 280 studies where additional imaging was needed but no biopsy was performed, (3) 112 benign biopsied studies, and (4) 89 studies with cancer. Our dataset included masses and architectural distortions which were annotated by two experienced radiologists. Additionally, we developed a single-phase deep learning detection model and tested it using our dataset to serve as a baseline for future research. Our model reached a sensitivity of 65% at 2 false positives per breast. Our large, diverse, and highly-curated dataset will facilitate development and evaluation of AI algorithms for breast cancer screening through providing data for training as well as common set of cases for model validation. The performance of the model developed in our study shows that the task remains challenging and will serve as a baseline for future model development.

研究の動機と目的

  • デジタル乳房トモサインティーズ(DBT)が乳腺がんスクリーニングに用いられる際の、大規模かつ正確にラベル付けされた、公開可能なデータセットの不足に対処すること。
  • DBTボリューム内のマスおよびアーキテクチャ的歪みを検出する、強固なワンフェーズのディープラーニングモデルを開発すること。
  • DBTにおけるAIモデルのトレーニングおよび評価のための標準化されたベンチマークを提供し、研究間の再現性と比較可能性を向上させること。
  • 臨床データに直接アクセスできない研究者を支援するため、共有され、多様性に富んだデータセットを用いたトレーニングおよび検証を可能にすること。

提案手法

  • データセットはDuke Health SystemのDEDUCEツールから収集され、2014年1月から2018年1月までの間、レポートに「トモサインティーズ」または「乳房」という語を含むDBT研究を抽出した。
  • すべてのDBTボリュームは再構成され、個人を特定できないように処理された。5,060名の患者が、正常、追加画像撮影が必要、良性生検、がんの4つのカテゴリーに分類され、合計22,032件の研究が含まれた。
  • 2名の経験豊富な放射線科医が、DBTボリューム内のマスおよびアーキテクチャ的歪みを独立してラベル付けし、モデルトレーニングおよび評価のための高品質な真のラベルを確保した。
  • 分類の偏りが著しい状況に対処するため、フォーカル損失を用いて、マンモグラフィーの事前学習を一切行わず、ワンフェーズの3次元畳み込みニューラルネットワークをトレーニングした。
  • モデルの評価には、ボリュームごとの検出フレームワークを用い、予測されたボックスが真のラベルの中心点を完全に含む場合にのみ真の陽性と定義した。
  • 性能評価には自由応答受信器特性(FROC)曲線が用いられ、ボリュームベースおよび乳房ベースの両方の評価指標が適用された。

実験結果

リサーチクエスチョン

  • RQ1専門家がラベル付けしたマスおよびアーキテクチャ的歪みを含む大規模で公開可能なDBTデータセットは、AIを用いた乳腺がんスクリーニング研究における再現性を向上させることができるか?
  • RQ2限られたトレーニングデータを用いて、DBTボリューム内のマスおよびアーキテクチャ的歪みを検出するワンフェーズのディープラーニングモデルは、どの程度効果的か?
  • RQ3極度のクラス不均衡下で、124例のがんおよび175例の良性病変しか存在しない状況において、どの損失関数が検出性能を最適化するか?
  • RQ4マンモグラフィーで事前学習されたモデルと比較して、DBTデータのみでトレーニングされたモデルは、同一の評価プロトコル下でどの程度の性能を示すか?
  • RQ5正常例および臨床的意義のある症例を含めることで、ベンチマークデータセットの臨床的現実性および一般化能はどの程度向上するか?

主な発見

  • データセットには、5,060名の患者から得られた22,032件のDBTボリュームが含まれており、うち5,129件が正常、280件が追加画像撮影が必要、112件が良性生検、89件のがん例が含まれる。
  • フォーカル損失を用いてトレーニングしたディープラーニングモデルは、テストセットで1つの乳房あたり2件の偽陽性を示した際の感度65%を達成した。がん例では67%の感度を示した。
  • テストセットでは、1つのDBTボリュームあたり2件の偽陽性を示した際の感度は42%にとどまり、限られた陽性トレーニング例がある中で中程度の性能を示した。
  • フォーカル損失は、バイナリクロスエントロピーおよび重み付きバイナリクロスエントロピーを上回り、3次元ボリュームベースの評価で1つのボリュームあたり2件の偽陽性を示した際の感度60%を達成した。
  • 良性病変の検出よりもがん例の検出で高い性能を示した(1つの乳房あたり2件の偽陽性で67%の感度)、非悪性だが臨床的意義のある所見の検出が困難であることが示された。
  • 中心点の包含を厳密な基準とする3次元ボリュームベースの評価フレームワークを用いることで、大きなバウンディングボックスの予測に対する耐性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。