Skip to main content
QUICK REVIEW

[論文レビュー] Exploration of Interpretability Techniques for Deep COVID-19 Classification using Chest X-ray Images

Soumick Chatterjee, Fatima Saad|arXiv (Cornell University)|Jun 3, 2020
COVID-19 diagnosis using AI被引用数 11
ひとこと要約

本研究では、胸部レントゲン画像を用いたCOVID-19、肺炎、健常者の多ラベル分類を目的として、深層学習モデル(ResNet18、ResNet34、InceptionV3、InceptionResNetV2、DenseNet161)およびそのアンサンブルを評価し、複数の解釈可能性技術を用いた。アンサンブルモデルはマイクロ-F1スコア0.89を達成し、ResNetsは肺の生物学的に関連する領域に焦点を当てることで優れた解釈可能性を示した。

ABSTRACT

The outbreak of COVID-19 has shocked the entire world with its fairly rapid spread and has challenged different sectors. One of the most effective ways to limit its spread is the early and accurate diagnosing infected patients. Medical imaging, such as X-ray and Computed Tomography (CT), combined with the potential of Artificial Intelligence (AI), plays an essential role in supporting medical personnel in the diagnosis process. Thus, in this article five different deep learning models (ResNet18, ResNet34, InceptionV3, InceptionResNetV2 and DenseNet161) and their ensemble, using majority voting have been used to classify COVID-19, pneumoniæ and healthy subjects using chest X-ray images. Multilabel classification was performed to predict multiple pathologies for each patient, if present. Firstly, the interpretability of each of the networks was thoroughly studied using local interpretability methods - occlusion, saliency, input X gradient, guided backpropagation, integrated gradients, and DeepLIFT, and using a global technique - neuron activation profiles. The mean Micro-F1 score of the models for COVID-19 classifications ranges from 0.66 to 0.875, and is 0.89 for the ensemble of the network models. The qualitative results showed that the ResNets were the most interpretable models. This research demonstrates the importance of using interpretability methods to compare different models before making a decision regarding the best performing model.

研究の動機と目的

  • 胸部レントゲン画像を用いたCOVID-19、肺炎、健常者の多ラベル分類のための深層学習モデルの開発および評価。
  • 局所的およびグローバルな解釈可能性手法を用いたモデルの解釈性の評価を通じて、臨床的信頼性と意思決定支援の向上。
  • ResNets、Inception、DenseNetといった多様なアーキテクチャの分類性能および解釈性の比較。
  • 多数決によるアンサンブルが分類のロバスト性および一般化性能を向上させることの可能性の調査。
  • 視覚的注目領域および活性化パターンに基づき、臨床的デプロイメントに適した最も解釈可能で信頼性の高いモデルの同定。

提案手法

  • COVID-19および肺炎の画像を統合した多ラベル胸部レントゲン画像データセット上で、事前学習済みの深層学習モデル5つ(ResNet18、ResNet34、InceptionV3、InceptionResNetV2、DenseNet161)を微調整した。
  • 入力画像内の注目領域を可視化するために、オクルージョン、セマンティックマップ、入力×勾配、ガイドドバックプロパゲーション、統合勾配、DeepLIFTといった局所的解釈可能性手法を適用した。
  • ニューロンの活性化プロファイルを用いて、ネットワークの各層における特徴学習のパターンを分析することで、グローバルな解釈性を評価した。
  • 5つのモデルの多数決によるアンサンブルモデルを作成し、分類性能の向上と個々のモデルの欠陊を緩和した。
  • 医療専門家による注目マップの定性的な分析を通じて、注目領域の生物学的関連性を検証した。
  • データセットは、公的リポジトリから調入手がかり:CohenらのCOVID-19レントゲン画像およびMooneyのデータセットからの肺炎レントゲン画像。

実験結果

リサーチクエスチョン

  • RQ1どの深層学習アーキテクチャが、胸部レントゲン画像を用いたCOVID-19、肺炎、健常者の多ラベル分類において最も優れた性能を示すか?
  • RQ2異なる局所的およびグローバルな解釈可能性技術は、医療画像における深層学習モデルの意思決定プロセスをどの程度効果的に明らかにできるか?
  • RQ3モデルの注目マップは、肺やガラス状浸潤などの放射線的関連領域とどの程度一致するか?
  • RQ4多数決によるモデルアンサンブルは、個々のモデルと比較して分類性能およびロバスト性を向上させることができるか?
  • RQ5DenseNet161のような特定のモデルが、高い正確性を示す一方で解釈性が低いのはなぜか?これはモデルの複雑さと一般化性能に関する何を示唆するか?

主な発見

  • アンサンブルモデルは最高のマイクロ-F1スコア0.89を達成し、個々のモデルのスコア(0.66~0.875)を上回った。
  • ResNet18およびResNet34は優れた解釈性を示し、注目マップが一貫して解剖学的に関連する肺領域に焦点を当てていた。
  • DenseNet161は最高の分類性能を示したが、生物学的に関連のない領域に注目していた可能性が高く、過学習または高すぎるモデルの複雑さが原因と考えられた。
  • 死活ニューロン数が最も多いモデルはDenseNet161であり、これは与えられたタスクに対して過剰にパrameter化されている可能性を示唆した。
  • 解釈性分析の結果、ResNetsはInceptionResNetV2のようなより深いモデルと比較して、より信頼性が高く臨床的に妥当な解釈性を示した。
  • 本研究は、解釈性がモデル選択において極めて重要であることを確認した。高い正確性が、臨床的信頼性や生物学的妥当性を保証するわけではない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。