Skip to main content
QUICK REVIEW

[論文レビュー] Comparative study of deep learning methods for the automatic segmentation of lung, lesion and lesion type in CT scans of COVID-19 patients

Sofie Tilborghs, Ine Dirks|arXiv (Cornell University)|Jul 29, 2020
COVID-19 diagnosis using AI被引用数 14
ひとこと要約

本研究では、10の異なる機関からなるマルチセンター・データセットを用いて、COVID-19 CT画像における肺、病変、病変タイプの自動セグメンテーションを目的とした12種類のディープラーニング手法を評価した。アンサンブル手法を適用することで性能が著しく向上し、平均Diceスコアは肺で0.982、二値病変で0.724、多クラス病変で0.469を達成した。体積誤差は人間レーティングのばらつきを下回っており、病変の定量的評価において臨床応用が可能であることを示している。

ABSTRACT

Recent research on COVID-19 suggests that CT imaging provides useful information to assess disease progression and assist diagnosis, in addition to help understanding the disease. There is an increasing number of studies that propose to use deep learning to provide fast and accurate quantification of COVID-19 using chest CT scans. The main tasks of interest are the automatic segmentation of lung and lung lesions in chest CT scans of confirmed or suspected COVID-19 patients. In this study, we compare twelve deep learning algorithms using a multi-center dataset, including both open-source and in-house developed algorithms. Results show that ensembling different methods can boost the overall test set performance for lung segmentation, binary lesion segmentation and multiclass lesion segmentation, resulting in mean Dice scores of 0.982, 0.724 and 0.469, respectively. The resulting binary lesions were segmented with a mean absolute volume error of 91.3 ml. In general, the task of distinguishing different lesion types was more difficult, with a mean absolute volume difference of 152 ml and mean Dice scores of 0.369 and 0.523 for consolidation and ground glass opacity, respectively. All methods perform binary lesion segmentation with an average volume error that is better than visual assessment by human raters, suggesting these methods are mature enough for a large-scale evaluation for use in clinical practice.

研究の動機と目的

  • COVID-19 CT画像における肺、病変、病変タイプのセグメンテーションを目的とした12種類のディープラーニング手法の性能を体系的に比較すること。
  • 複数の施設にまたがる環境において、自社開発および公開済みのディープラーニングモデルのロバスト性と一般化性能を評価すること。
  • アンサンブル手法が二値および多クラス病変セグメンテーションの精度を向上させるかどうかを検証すること。
  • 人間レーティングの性能と比較することで、自動セグメンテーションの臨床的実用性を評価すること。
  • すべての開発手法のコードを公開し、再現性および臨床応用を支援すること。

提案手法

  • 10の異なる機関からなるマルチセンターのCTスキャン100例を用いたデータセットを用い、肺、二値病変、および5つの病変タイプ(GGO、CON、CPP、COM、OAT)のアノテーションを実施した。
  • 7つの自社開発モデル(DMLu、WASS、2DS、UNWM、2DRnx、DMmc、DMLo)と4つの公開モデル(CTA、JoHof、InfNet、CovidENet)を評価し、内部モデルには5分割交差検証、公開モデルには外部テストセットを適用した。
  • 性能評価には、Dice類似係数(DSC)、95百分位数のハウスドルフ距離(HD95)、平均表面差分(ASD)、平均体積差分(AVD)を用いた。
  • 複数のモデルの予測をメジャー投票により統合するアンサンブル手法を適用し、すべてのセグメンテーションタスクにおいてロバスト性と性能が向上した。
  • テストセットはトレーニングデータとは独立しており、異なる施設およびアノテーションツールを用いたケースを含め、一般化性能の確保とデータ漏洩の回避を図った。
  • すべてのモデルは総病変体積予測について評価され、先行研究における人間レーティングのばらつきと比較した。

実験結果

リサーチクエスチョン

  • RQ1異なるディープラーニング手法は、マルチセンターのCOVID-19 CT画像において、肺、二値病変、多クラス病変タイプのセグメンテーションでどのように性能を発揮するか?
  • RQ2複数のディープラーニングモデルをアンサンブル化することで、さまざまな病変タイプやタスクにおいてセグメンテーション性能が向上するか?
  • RQ3臨床現場における人間レーティングの誤差と比較して、自動セグメンテーション手法の体積誤差はどの程度か?
  • RQ4公開モデルと自社開発モデルの両方が、多様な画像診断施設およびプロトコルにおいて、どの程度の一般化能力を有しているか?
  • RQ5モデルの予測は、疾患の重症度および進行度を評価するための臨床的意思決定をどの程度支援できるか?

主な発見

  • ディープラーニングモデルのアンサンブル化により、肺セグメンテーションの平均Diceスコアは0.982、二値病変セグメンテーションは0.724、多クラス病変セグメンテーションは0.469に向上した。
  • 二値病変セグメンテーションにおける平均体積差分(AVD)は91.3 mlであり、先行研究で報告された人間レーティングのばらつきの閾値122 mlを下回っていた。
  • 多クラスセグメンテーションでは、強化(CON)のAVDが最低で4.87 ml、狂大部分(CPP)が37.0 ml、GGOではUNWM手法で122 mlのAVDを示した。
  • グラウンド・グラス・オパシティ(GGO)の平均Diceスコアは0.369、強化(CON)は0.523であり、これらの病変タイプを区別するのが特に困難であることが示された。
  • すべての自動手法が人間レーティングより低い体積誤差を達成しており、大規模な臨床的評価に十分に成熟していることが示唆された。
  • 自社開発および公開済みの実装を含む12のすべてのモデルのコードを、再現性および臨床統合を支援する目的で公開する予定である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。