Skip to main content
QUICK REVIEW

[論文レビュー] Lung CT Imaging Sign Classification through Deep Learning on Small Data

Guocai He|arXiv (Cornell University)|Mar 1, 2019
COVID-19 diagnosis using AI参考文献 16被引用数 5
ひとこと要約

本論文は、条件付き変分オートエンコーダー生成対抗ネットワーク(CVAE-GAN)を用いて、小規模データセットにおける肺CT画像所見(CISL)の分類のための2段階のディープラーニング手法を提案する。まず、CVAE-GANを用いて高品質な合成データを生成し、それをCNNの事前学習に活用した後、実際のデータで微調整を行う。このアプローチにより、二値分類で95.0%の平均正答率、多値分類で91.83%の正答率を達成し、従来のデータ拡張法やImageNetからの転移学習を上回る性能を示した。

ABSTRACT

The annotated medical images are usually expensive to be collected. This paper proposes a deep learning method on small data to classify Common Imaging Signs of Lung diseases (CISL) in computed tomography (CT) images. We explore both the real data and the data generated by Generative Adversarial Network (GAN) to improve the reliability and the generalization of learning. First, we use GAN to generate a large number of CISLs from small annotated data, which are difficult to be distinguished from real counterparts. These generated samples are used to pre-train a Convolutional Neural Network (CNN) for classifying CISLs. Second, we fine-tune the CNN classification model with real data. Experiments were conducted on the LISS database of CISLs. We successfully convinced radiologists that our generated CISLs samples were real for 56.7% of our experiments. The pre-trained CNN model achieves 88.4% of mean accuracy of binary classification, and after fine-tuning, the mean accuracy is significantly increased to 95.0%. For multi-classification of all types of CISLs and normal tissues, through the two stages of training, the mean accuracy, sensitivity and specificity are up to about 91.83%, 92.73% and 99.0%, respectively. To our knowledge, this is the best result achieved on the LISS database, which demonstrates that the proposed method is effective and promising for fulfilling deep learning on small data.

研究の動機と目的

  • ディープラーニングモデルの学習に必要なアノテーション付き肺CT画像が限られているという課題に対処すること。
  • 小規模データセットにおける肺疾患の一般的な画像所見(CISL)のCNNベース分類の汎化性能と信頼性を向上させること。
  • ImageNetのような大規模外部データセットに依存せずに、過学習を低減し、性能を向上させる手法を開発すること。
  • 放射線科医による評価を通じて生成されたCISLの品質を検証し、従来のデータ拡張法や転移学習と比較して本手法の性能を検証すること。

提案手法

  • CVAE-GANを、実際の小規模CISLデータに限定して学習させ、高精細な合成画像所見を生成する。
  • 生成されたCISLサンプルを用いて、特徴量の学習を向上させるため、畳み込みニューラルネットワーク(CNN)を事前学習する。
  • 事前学習済みのCNNを、実際のCISLデータで微調整し、ターゲットの分布に適応させ、分類精度を向上させる。
  • 2段階の学習プロセス(合成データでの事前学習に続く実データでの微調整)は、ドメイン特化型のデータ拡張として機能する。
  • 本手法はImageNetの事前学習に依存せず、医療画像ドメインに特化したGAN生成データを用いる。
  • アブレーションスタディでは、従来のデータ拡張法やImageNetからの転移学習と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1専門放射線科医が、GANで生成された合成肺CT画像所見を本物と識別できない程度に高品質であるか?
  • RQ2GANで生成されたCISLデータでCNNを事前学習することで、実際の小規模データセットにおける分類性能が向上するか?
  • RQ3本手法の2段階学習プロトコルは、従来のデータ拡張法と比較して、正答率と一般化性能において優れているか?
  • RQ4限られた医療画像データセットにおいて、本手法はImageNetからの転移学習を上回る性能を示せるか?
  • RQ5本手法は、低データ環境下における肺CT所見分類の過学習をどの程度低減できるか?

主な発見

  • 放射線科医が生成されたGANによるCISLサンプルの56.7%を本物と誤認した。これは合成データの高品質さを裏付ける。
  • 微調整後、二値分類の平均正答率は95.0%に達し、事前学習のみで達成された88.4%よりも顕著に高い。
  • すべてのCISLタイプおよび正常組織の多値分類において、本手法は91.83%の正答率、92.73%の感度、99.0%の特異度を達成した。
  • 本手法は、従来のデータ拡張法およびImageNetからの転移学習を上回り、特に感度と特異度の面で優れた性能を示した。
  • 2段階学習スキームは、過学習を効果的に低減し、小規模な医療画像データセットにおけるモデルの一般化性能を向上させた。
  • 結果から、医療画像分類において、ドメイン特化型のGANによるデータ生成は、一般的なデータ拡張や一般的な事前学習よりも効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。