[論文レビュー] Fine-Tuning and Training of DenseNet for Histopathology Image Representation Using TCGA Diagnostic Slides
本稿では、TCGAの全スライド画像から20×倍率のヒストパスロジー画像パッチ約24万枚を用い、高細胞密度モザイク法から得られる弱いラベルを用いて、DenseNetに基づくKimiaNetを提示する。KimiaNetは、事前学習済みDenseNetやより小さなカスタム畳み込みニューラルネットワークと比較して、画像分類およびリtrievalタスクで優れた性能を示しており、ドメイン特化した微調整がデジタル病理会診における深層特徴表現を顕著に向上させることを示している。
Feature vectors provided by pre-trained deep artificial neural networks have become a dominant source for image representation in recent literature. Their contribution to the performance of image analysis can be improved through finetuning. As an ultimate solution, one might even train a deep network from scratch with the domain-relevant images, a highly desirable option which is generally impeded in pathology by lack of labeled images and the computational expense. In this study, we propose a new network, namely KimiaNet, that employs the topology of the DenseNet with four dense blocks, fine-tuned and trained with histopathology images in different configurations. We used more than 240,000 image patches with 1000x1000 pixels acquired at 20x magnification through our proposed "highcellularity mosaic" approach to enable the usage of weak labels of 7,126 whole slide images of formalin-fixed paraffin-embedded human pathology samples publicly available through the The Cancer Genome Atlas (TCGA) repository. We tested KimiaNet using three public datasets, namely TCGA, endometrial cancer images, and colorectal cancer images by evaluating the performance of search and classification when corresponding features of different networks are used for image representation. As well, we designed and trained multiple convolutional batch-normalized ReLU (CBR) networks. The results show that KimiaNet provides superior results compared to the original DenseNet and smaller CBR networks when used as feature extractor to represent histopathology images.
研究の動機と目的
- ドメイン特化した微調整およびトレーニングを用いて、ヒストパスロジー画像における深層特徴表現を向上させること。
- 全スライド画像からの弱いラベルを活用することで、デジタル病理会診におけるラベル付きデータの限界を克服すること。
- ImageNetで事前学習されたモデルを用いたトランスファーラーニングと比較して、ヒストパスロジー画像データ上で微調整するか、またはスクラッチからトレーニングすることで、より優れた性能が得られるかどうかを評価すること。
- ピクセル単位のアノテーションを必要としない、高解像度の病理画像に対する深層ネットワークのトレーニングのスケーラブルで再現可能な手法を開発すること。
提案手法
- 20×倍率の全スライド画像から1000×1000ピクセルのパッチを高細胞密度モザイク法を用いて生成し、WSIレベルのラベルをトレーニングに活用可能にした。
- 4つのディンスブロックを備えたDenseNetを基盤とするKimiaNetを、TCGAのヒストパスロジーパッチ約24万枚を用いて微調整およびスクラッチからトレーニングした。
- ピクセル単位のアノテーションを避けるために、7,126枚の全スライド画像からの弱いラベルを用いてモデルをトレーニングした。
- 比較のため、スモール、ラージT、ラージW、および5ブロックに変更したスモールの4つのより小さな畳み込みバッチ正規化ReLU(CBR)ネットワークを実装し、スクラッチからトレーニングした。
- CBRネットワークの最終全結合層の直前に、特徴表現の向上を図るため、ドロップアウト層を追加した。
- 画像検索と分類タスクの評価を、3つの公的データセット(TCGA、子宮内膜がん、大腸がん)を用いて実施した。
実験結果
リサーチクエスチョン
- RQ1ヒストパスロジー画像上でDenseNetを微調整するか、スクラッチからトレーニングすることで、ImageNetで事前学習されたモデルを用いる場合と比較して、より優れた画像表現が得られるか?
- RQ2ピクセル単位のアノテーションを必要とせずに、全スライド画像からの弱いラベルを有効に活用して深層ネットワークをトレーニングできるか?
- RQ3特徴抽出器として用いた場合、KimiaNetはより小さなカスタムCBRネットワークと比較して、ヒストパスロジー画像解析においてどの程度の性能差を示すか?
- RQ4高細胞密度モザイクによるパッチ生成が、デジタル病理会診におけるモデルの一般化性能および特徴品質に与える影響は何か?
主な発見
- KimiaNetは、水平画像検索において、2番目に優れたモデル(LargeT)と比較して平均正答率が30%高く、全12クラスにわたる一貫性ある性能を示した。
- 垂直検索において、26クラス中23クラスで最大のF1スコアを記録し、平均および最大F1スコアの両面で他のすべてのモデルを上回った。
- KimiaNetの平均F1スコアは、2番目に優れたモデル(LargeW)と比較して10%高く、標準偏差が最小であったため、優れた安定性を示した。
- 分類およびリtrievalタスクの両方において、KimiaNetは元のImageNetで事前学習されたDenseNetおよびすべてのより小さなCBRネットワークを上回った。
- 最終全結合層の直前にドロップアウト層を追加することは、CBRネットワークの性能向上に不可欠であり、特徴品質の顕著な向上をもたらした。
- 高細胞密度モザイク法により、弱いラベルの有効活用が可能となり、特定の組織像特徴に偏る可能性はあったが、大規模なトレーニングが可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。