Skip to main content
QUICK REVIEW

[論文レビュー] Comprehensive Comparison of Deep Learning Models for Lung and COVID-19 Lesion Segmentation in CT scans

Paschalis Bizopoulos, Nicholas Vretos|arXiv (Cornell University)|Sep 10, 2020
COVID-19 diagnosis using AI被引用数 8
ひとこと要約

本論文は、CTスキャンにおける肺およびCOVID-19病変のセグメンテーションのための600のディープラーニングモデルの包括的ベンチマークを提示する。4つのアーキテクチャ(U-Net、LinkNet、FPN、PSPNet)と25種類の事前学習済みおよびランダム初期化されたエンコーダーを組み合わせたものである。研究では最適なアーキテクチャ-エンコーダーの組み合わせを特定し、ImageNetでの事前学習が性能を顕著に向上させることを示し、GPUを必要としない微調整を可能にするために、すべてのモデルとコードを公開する。

ABSTRACT

Recently there has been an explosion in the use of Deep Learning (DL) methods for medical image segmentation. However the field's reliability is hindered by the lack of a common base of reference for accuracy/performance evaluation and the fact that previous research uses different datasets for evaluation. In this paper, an extensive comparison of DL models for lung and COVID-19 lesion segmentation in Computerized Tomography (CT) scans is presented, which can also be used as a benchmark for testing medical image segmentation models. Four DL architectures (Unet, Linknet, FPN, PSPNet) are combined with 25 randomly initialized and pretrained encoders (variations of VGG, DenseNet, ResNet, ResNext, DPN, MobileNet, Xception, Inception-v4, EfficientNet), to construct 200 tested models. Three experimental setups are conducted for lung segmentation, lesion segmentation and lesion segmentation using the original lung masks. A public COVID-19 dataset with 100 CT scan images (80 for train, 20 for validation) is used for training/validation and a different public dataset consisting of 829 images from 9 CT scan volumes for testing. Multiple findings are provided including the best architecture-encoder models for each experiment as well as mean Dice results for each experiment, architecture and encoder independently. Finally, the upper bounds improvements when using lung masks as a preprocessing step or when using pretrained models are quantified. The source code and 600 pretrained models for the three experiments are provided, suitable for fine-tuning in experimental setups without GPU capabilities.

研究の動機と目的

  • 一貫したデータセットと評価プロトコルを用いて、肺および病変セグメンテーションにおけるディープラーニングモデルを評価するための標準化されたベンチマークを確立すること。
  • 肺セグメンテーション、病変セグメンテーション、および事前処理としての肺マスクを用いた病変セグメンテーションの文脈において、最も効果的なアーキテクチャ-エンコーダーの組み合わせを特定すること。
  • ランダム初期化とImageNetでの重み初期化の影響を、セグメンテーション性能の観点から比較すること。
  • 600の事前学習済みモデルとソースコードを公開し、再現性を確保するとともに、GPUリソースなしでの微調整を支援すること。
  • 従来の医療画像セグメンテーション研究における一貫したベースラインの欠如とデータセットの多様性の不足に取り組むこと。

提案手法

  • 本研究では、U-Net、LinkNet、FPN、PSPNetの4つのセグメンテーションアーキテクチャを、ResNet、DenseNet、EfficientNet、MobileNetなどの25種類の異なるエンコーダーネットワークと組み合わせて評価する。
  • 各モデルは、100枚のトレーニング/バリデーションスキャンと別々のテストセット(9体積)を有する専用のCOVID-19 CTデータセット上でトレーニングおよび評価される。
  • 3つの実験設定を用いる:(1) 肺セグメンテーション、(2) 病変セグメンテーション、(3) 事前に計算された肺マスクを入力として用いた病変セグメンテーション。
  • すべてのモデルにおいて、ランダム初期化とImageNet事前学習済み重みの初期化を比較する。
  • 小さなデータセットサイズを補うために、トレーニング中にデータオーグメンテーションを適用する。
  • 事前学習済みモデルとソースコードはGitHubを通じて公開され、コミュニティによる再利用および微調整が可能になる。

実験結果

リサーチクエスチョン

  • RQ1CTスキャンにおける肺セグメンテーションにおいて、どのアーキテクチャ-エンコーダーの組み合わせが最高のDiceスコアを達成するか?
  • RQ2事前に計算された肺マスクを入力として用いることで、病変セグメンテーション性能にどのような影響を与えるか?
  • RQ3病変および肺セグメンテーションにおいて、ImageNet事前学習済み重みとランダム初期化の間で、性能向上はどの程度か?
  • RQ4異なるエンコーダー・アーキテクチャ(例:ResNet対EfficientNet)は、すべての実験においてセグメンテーション精度の観点でどのように比較されるか?
  • RQ5より多くのエポックでトレーニングすることで、ランダム初期化とImageNet初期化の間の性能差はどの程度縮まるか?

主な発見

  • 肺セグメンテーションにおいて最も高い性能を示したのは、DenseNet-121エンコーダーを搭載したU-Netで、平均Diceスコアは96.8%を達成した。
  • 事前肺マスクを用いない病変セグメンテーションにおいて最良のモデルは、ResNeXt-50エンコーダーを搭載したU-Netで、平均Diceスコアは84.2%を達成した。
  • 肺マスクを入力として用いた場合、最良のモデルはResNet-101エンコーダーを搭載したU-Netで、平均Diceスコアは87.1%を達成した。
  • ImageNet事前学習により、すべての実験において平均して4.3ポイントのDiceスコア向上が見られた(ランダム初期化と比較)。
  • ランダム初期化とImageNet初期化の間の性能差は、エポック数を増やすことで減少し、ランダム重みが効果的な表現に収束していることを示唆している。
  • 本研究では、エンコーダーの選択が性能に顕著な影響を与えることが示された。特に、DenseNetおよびResNeXtのバリエーションは、常に上位にランクインした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。