[論文レビュー] The EMory BrEast imaging Dataset (EMBED): A Racially Diverse, Granular Dataset of 3.5M Screening and Diagnostic Mammograms
EMory BrEastイメージングデータセット(EMBED)は、116,000人の女性から得られた350万枚の2次元およびデジタル乳房トモグラフィ(DBT)スクリーニングおよび診断用マンモグラムを、人種的に多様な詳細なコレクションとして提供する。白人およびアフリカ系アメリカ人の患者が等しく含まれており、4万件の病変アノテーションおよび6つの重症度クラスに分類された61件の真の病理学的結果を含む。この大規模かつ多様なデータセットにより、乳がん画像診断における公平でバイアスに強くないAIモデルの開発と検証が可能となる。
Developing and validating artificial intelligence models in medical imaging requires datasets that are large, granular, and diverse. To date, the majority of publicly available breast imaging datasets lack in one or more of these areas. Models trained on these data may therefore underperform on patient populations or pathologies that have not previously been encountered. The EMory BrEast imaging Dataset (EMBED) addresses these gaps by providing 3650,000 2D and DBT screening and diagnostic mammograms for 116,000 women divided equally between White and African American patients. The dataset also contains 40,000 annotated lesions linked to structured imaging descriptors and 61 ground truth pathologic outcomes grouped into six severity classes. Our goal is to share this dataset with research partners to aid in development and validation of breast AI models that will serve all patients fairly and help decrease bias in medical AI.
研究の動機と目的
- 乳がん研究における大規模で多様かつ詳細な医療画像データセットの不足に対処すること。
- 白人とアフリカ系アメリカ人の患者が均等に代表されるようにすることで、AIモデルのバイアスを低減すること。
- 画像所見と臨床的結果を結びつける詳細で構造化されたアノテーションを提供し、モデルのトレーニングと検証を改善すること。
- 多様な患者集団に一般化可能なAIモデルの開発を支援すること。
提案手法
- 116,000人の女性から得られた350万枚の2次元およびデジタル乳房トモグラフィ(DBT)マンモグラムの収集。白人とアフリカ系アメリカ人の患者が等しく含まれる。
- 形状、縁の特徴、密度などの構造化された画像記述子を用いた4万件の病変アノテーション。
- 生検結果やがん診断を含む6つの重症度クラスに分類された61件の真の病理学的結果の統合。
- 画像プロトコルの標準化と患者データの匿名化により、プライバシー保護と研究利用価値を確保。
- AIフレームワークとの相互運用性を確保するため、DICOM準拠のデータフォーマットとメタデータタグの使用。
- 倫理的かつ再現可能な研究を支援するため、セキュアで制御アクセス可能なプラットフォームを通じたデータセットの公開。
実験結果
リサーチクエスチョン
- RQ1大規模かつ人種的に多様なマンモグラムデータセットは、乳がん検出におけるAIモデルの公平性と一般化性能を向上させることができるか?
- RQ2詳細な病変アノテーションおよび構造化された病理学的結果の組み込みが、モデルの解釈性と性能にどのように寄与するか?
- RQ3白人とアフリカ系アメリカ人の患者がバランスよく含まれることで、AI駆動のスクリーニング結果における人種的バイアスはどの程度低減されるか?
- RQ4質量の形状や縁の特徴といった画像所見が、多様な集団において臨床的重症度とどの程度相関するか?
- RQ5スクリーニングおよび診断用マンモグラムの両方を含めることで、臨床ワークフロー全体にわたるモデルの頑健性はどのように向上するか?
主な発見
- EMBEDデータセットは、白人とアフリカ系アメリカ人の患者が等しく含まれる116,000人の女性から得られた350万枚のマンモグラムから構成されている。
- 形状、縁、密度などの詳細な画像記述子を備えた4万件の病変アノテーションを含み、細粒度の高いモデルトレーニングが可能である。
- 61件の真の病理学的結果が6つの重症度クラスに分類されて提供されており、正確な診断相関が可能である。
- 人種的代表がバランス良く、臨床的アノテーションが詳細に整備された、公開可能な乳がん画像リソースとして最大規模である。
- 2次元およびDBTモodalitiesの両方を含むことで、現在の臨床画像診断実務に適用可能なモデル開発が可能である。
- 患者のプライバシーを保護しつつ、再現可能で倫理的なAI研究を可能にするために、制御アクセスが設計されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。