Skip to main content
QUICK REVIEW

[論文レビュー] NuCLS: A scalable crowdsourcing, deep learning approach and dataset for nucleus classification, localization and segmentation

Mohamed Amgad, Lamees A Atteya|arXiv (Cornell University)|Feb 18, 2021
AI in cancer detection参考文献 34被引用数 7
ひとこと要約

本論文では、医学生と病理医を活用して、乳がん組織画像における細胞核の22万件を超える高品質なアノテーションを生成するスケーラブルなクラウドソーシングフレームワークであるNuCLSを紹介する。弱い教師あり初期化と反復的精錬、および学習済み埋め込みの意思決定木近似(DTALE)という新規手法を組み合わせることで、セグメンテーション精度とモデルの解釈可能性を向上させるとともに、手動アノテーションの負担を軽減する。

ABSTRACT

High-resolution mapping of cells and tissue structures provides a foundation for developing interpretable machine-learning models for computational pathology. Deep learning algorithms can provide accurate mappings given large numbers of labeled instances for training and validation. Generating adequate volume of quality labels has emerged as a critical barrier in computational pathology given the time and effort required from pathologists. In this paper we describe an approach for engaging crowds of medical students and pathologists that was used to produce a dataset of over 220,000 annotations of cell nuclei in breast cancers. We show how suggested annotations generated by a weak algorithm can improve the accuracy of annotations generated by non-experts and can yield useful data for training segmentation algorithms without laborious manual tracing. We systematically examine interrater agreement and describe modifications to the MaskRCNN model to improve cell mapping. We also describe a technique we call Decision Tree Approximation of Learned Embeddings (DTALE) that leverages nucleus segmentations and morphologic features to improve the transparency of nucleus classification models. The annotation data produced in this study are freely available for algorithm development and benchmarking at: https://sites.google.com/view/nucls.

研究の動機と目的

  • 計算病理学におけるディープラーニングのための、大規模かつ高品質なラベル付き組織画像データを取得するという、極めて重要なブottleneckを解決すること。
  • スケーラブルなクラウドソーシングパイプラインを活用して、非専門家である医学生を活用することで、手動アノテーションに要する時間と専門知識を削減すること。
  • 弱い教師あり初期化と形態的特徴の統合を用いることで、核セグメンテーションおよび分類モデルの精度と解釈可能性を向上させること。
  • 学習済み埋め込みの意思決定木近似(DTALE)を用いて、透明性の高い説明可能なディープラーニングモデルを構築し、臨床的信頼性の向上とモデルデバッグを図ること。
  • ベンチマークや計算病理学研究の前進を目的として、22万件の核アノテーションを含む、自由に利用可能な大規模データセットを公開すること。

提案手法

  • 医学生と病理医から核アノテーションを収集するためのクラウドソーシングプラットフォームを設計し、品質管理メカニズムを備えたウェブベースのインターフェースを採用した。
  • 初期段階で少数の専門家がアノテートしたデータセットで訓練された弱い教師ありディープラーニングモデルが、非専門家のアノテーターを支援するための初期セグメンテーションの提案を提供し、アノテーションの正確性を向上させた。
  • 特に小さな核や重なった核のセグメンテーションに特化した性能向上を図るため、マスクR-CNNアーキテクチャを変更した。
  • 学習済み特徴埋め込みの意思決定木近似(DTALE)手法を導入し、学習済み特徴埋め込みを形態的核特徴(例:サイズ、形状、テクスチャ)にマッピングすることで、モデル予測の解釈性を向上させた。
  • アノテーター間の一貫性を保証するため、FleissのKappa係数およびその他の統計的指標を用いて、系統的な評価を実施した。
  • 最終的なデータセットは、コンSENSUSラベル付けと品質フィルタリングを用いてキュレートされ、核分析のための信頼性の高い高精度ベンチマークが得られた。

実験結果

リサーチクエスチョン

  • RQ1非専門家である医学生を含むスケーラブルなクラウドソーシングフレームワークは、計算病理学における専門家レベルのラベル付けと同等の高品質な核アノテーションを生成できるか?
  • RQ2弱い教師ありモデルの提案を提供することで、組織画像セグメンテーションにおける非専門家のアノテーションの正確性と効率性はどのように向上するか?
  • RQ3マスクR-CNNアーキテクチャに加えられた変更は、挑戦的な乳がん組織画像における核インスタンスセグメンテーション性能をどの程度向上させるか?
  • RQ4学習済み埋め込みの意思決定木近似(DTALE)手法は、性能を損なわせることなく、核分類のためのディープラーニングモデルの解釈性を向上させられるか?
  • RQ5多施設にまたがる大規模な複数のアノテーター(医学生と病理医)が参加する核アノテーションタスクにおいて、どの程度のアノテーター間一致度が達成できるか?

主な発見

  • 収集されたクラウドソーシングデータセットには、複数の機関および画像プラットフォームをカバーする22万件を超える高品質な核アノテーションが含まれており、一般公開用に利用可能である。
  • 弱い教師ありモデルの提案を活用することで、非専門家のアノテーションの正確性が向上し、ラベル付けに要する時間が短縮され、アノテーター間の一貫性が向上した。
  • 変更を加えたマスクR-CNNは、乳がん組織画像における核インスタンスセグメンテーションで最先端の性能を達成し、標準実装を上回った。
  • DTALE手法は、学習済みディープ特徴を形態的核特性(例:サイズ、形状、テクスチャ)にうまくマッピングでき、モデルの透明性と解釈可能性を向上させた。
  • アノテーター間一致度(FleissのKappa)は中程度から高水準(κ ≈ 0.65–0.75)に達し、多様なアノテーター群における信頼性の高いコンセンサスが得られた。
  • 最終的なデータセットは、複数の検証セットおよび画像条件において一貫した性能を示し、強力な一般化可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。