[論文レビュー] Deep Learning Methods for Lung Cancer Segmentation in Whole-slide Histopathology Images -- the ACDC@LungHP Challenge 2019
本論文は、全スライド組織病理学画像(WSI)における画素単位の肺がん分類のための深層学習手法を評価するACDC@LungHP 2019チャレンジを提示する。150枚のトレーニングおよび50枚のテストWSIからなるデータセットを用い、最良のマルチモデル手法がDICE係数0.8372 ± 0.0858を達成し、観察者間一致度に近づいた。これは、デジタル病理学における自動肺がん診断のための深層学習の強力な可能性を示している。
Accurate segmentation of lung cancer in pathology slides is a critical step in improving patient care. We proposed the ACDC@LungHP (Automatic Cancer Detection and Classification in Whole-slide Lung Histopathology) challenge for evaluating different computer-aided diagnosis (CADs) methods on the automatic diagnosis of lung cancer. The ACDC@LungHP 2019 focused on segmentation (pixel-wise detection) of cancer tissue in whole slide imaging (WSI), using an annotated dataset of 150 training images and 50 test images from 200 patients. This paper reviews this challenge and summarizes the top 10 submitted methods for lung cancer segmentation. All methods were evaluated using the false positive rate, false negative rate, and DICE coefficient (DC). The DC ranged from 0.7354$\pm$0.1149 to 0.8372$\pm$0.0858. The DC of the best method was close to the inter-observer agreement (0.8398$\pm$0.0890). All methods were based on deep learning and categorized into two groups: multi-model method and single model method. In general, multi-model methods were significantly better ($ extit{p}$
研究の動機と目的
- 全スライド組織病理学画像(WSI)における画素単位の正確な肺がん分類のための深層学習ベースの手法を評価および比較すること。
- 200例の患者にわたる標準化されたベンチマークデータセットを用いて、さまざまな深層学習アーキテクチャおよびトレーニング戦略の性能を評価すること。
- モデルアンサンブル技術、事前学習済み重み、ラベルノイズの最適化が分類精度に与える影響を調査すること。
- 将来のチャレンジの基盤とすることを目的とし、WSIを用いた肺がん亜型の分類に焦点を当てる。
提案手法
- チャレンジでは、200名の患者から得られた150枚のトレーニングおよび50枚のテスト全スライド画像(WSI)のデータセットを用いた。病理学者によるアノテーションが提供された。
- すべての手法は深層学習に基づき、主に畳み込みニューラルネットワーク(CNN)であり、単一モデルとマルチモデルのアプローチに分類された。
- マルチモデル手法は、複数のネットワークの予測を組み合わせ、通常はアンサンブル平均化や投票戦略を用いて、耐性および性能を向上させた。
- 複数のチームがラベルの最適化技術を適用した。具体的には、Otsuのしきい値処理、バウンディングボックスフィルタリング、タイルベース処理を用いて、アノテーション内のバックグラウンドノイズを低減した。
- 3つのチームが事前学習済みImageNet重みを使用したが、自然画像と組織病理学画像のドメインシフトのため、一貫した性能向上は得られなかった。
- 評価には標準的な指標が用いられ、DICE係数(DC)、誤検出率(FPR)、誤検出率(FNR)が使用され、DCが主な性能指標として採用された。
実験結果
リサーチクエスチョン
- RQ1全スライド画像における画素単位の肺がん組織分類において、さまざまな深層学習アーキテクチャはどのように性能を発揮するか?
- RQ2複数のモデルを組み合わせること(アンサンブル手法)により、単一モデルと比較して分類性能が顕著に向上するか?
- RQ3事前学習済みImageNet重みは、組織病理学的WSI分類タスクにおいて、どの程度性能を向上させるか?
- RQ4ラベルの最適化は、WSI分類のトレーニングデータにおけるノイズや不正確なアノテーションに対処するために、どの程度重要か?
- RQ5深層学習モデルの性能は、病理学者間の観察者間一致度と比較してどの程度か?
主な発見
- 最高の手法がDICE係数0.8372 ± 0.0858を達成し、観察者間一致度0.8398 ± 0.0890に非常に近づいた。
- マルチモデル手法は単一モデル手法を顕著に上回り、平均DICEは0.7966 ± 0.0898(単一モデル:0.7544 ± 0.0991)であり、p < 0.01であった。
- 特に、Otsuのしきい値処理を用いて腫瘍アノテーションからバックグラウンドを除去するラベル最適化技術が、高いDICEスコアと関連した。
- 事前学習済みImageNet重みは一貫した性能向上をもたらさず、組織病理学分類においてドメインシフトがその利点を制限していると考えられた。
- 最良の手法は、最高で0.9508の精度と、最小で0.0948の誤検出率を示し、がん領域の強力な検出能力を示した。
- 結果から、深層学習モデルは専門的病理医の性能に匹敵する可能性を示しており、臨床意思決定支援システムへの応用が有効であると考えられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。