Skip to main content
QUICK REVIEW

[論文レビュー] Vision Transformer using Low-level Chest X-ray Feature Corpus for COVID-19 Diagnosis and Severity Quantification

Sang Joon Park, Gwanghyun Kim|arXiv (Cornell University)|Apr 15, 2021
COVID-19 diagnosis using AI参考文献 34被引用数 8
ひとこと要約

本論文は、大規模データセットから事前学習された低レベルの胸部X線(CXR)特徴埋め込みを活用することで、COVID-19の診断と重症度の定量化を向上させる、新しいビジョントランスフォーマー(ViT)フレームワークを提案する。22万枚を超えるCXR画像で事前学習されたバックボーンネットワークを用いて、一般的な異常(例:実質化、不透明度)を抽出することで、多様な外部データセットにおいて優れた汎化性能を示し、既存のCNNおよびViTベースラインを上回る最先端の性能を達成した。

ABSTRACT

Developing a robust algorithm to diagnose and quantify the severity of COVID-19 using Chest X-ray (CXR) requires a large number of well-curated COVID-19 datasets, which is difficult to collect under the global COVID-19 pandemic. On the other hand, CXR data with other findings are abundant. This situation is ideally suited for the Vision Transformer (ViT) architecture, where a lot of unlabeled data can be used through structural modeling by the self-attention mechanism. However, the use of existing ViT is not optimal, since feature embedding through direct patch flattening or ResNet backbone in the standard ViT is not intended for CXR. To address this problem, here we propose a novel Vision Transformer that utilizes low-level CXR feature corpus obtained from a backbone network that extracts common CXR findings. Specifically, the backbone network is first trained with large public datasets to detect common abnormal findings such as consolidation, opacity, edema, etc. Then, the embedded features from the backbone network are used as corpora for a Transformer model for the diagnosis and the severity quantification of COVID-19. We evaluate our model on various external test datasets from totally different institutions to evaluate the generalization capability. The experimental results confirm that our model can achieve the state-of-the-art performance in both diagnosis and severity quantification tasks with superior generalization capability, which are sine qua non of widespread deployment.

研究の動機と目的

  • パンデミック期におけるラベル付きCOVID-19 CXRデータの限界を補うために、一般的な異常を示す豊富なラベルなしCXRデータを活用すること。
  • 疾患分類から特徴学習を分離することで、COVID-19の診断と重症度定量化における汎化性能を向上させること。
  • ドメインのズレが最小限に抑えられ、多様な臨床現場に広く展開可能な堅牢で転送可能なモデルを開発すること。
  • 事前学習モデルから得られる低レベルのCXR特徴が、医療画像タスクにおけるViTの最適なコーパスであることを示すこと。

提案手法

  • CheXpertなどの公開CXRデータセットを用いて、コンsolidation、不透明度、浮腫れなどの一般的な低レベル所見を検出するバックボーンネットワークを大規模に事前学習する。
  • 事前学習済みバックボーンから特徴埋め込みを抽出し、ビジョントランスフォーマーの構造的コーパスとして利用する。
  • ViTアーキテクチャを用いて、これらの学習済み特徴埋め込みに注目を向け、CXR全体にわたる長距離依存関係をモデル化し、高レベルの診断を実現する。
  • 領域(ROI)のマックスプールを適用して、パッチごとの重症度マップをグローバルな重症度スコア配列に変換し、臨床的ラベルとの整合性を向上させる。
  • バックボーンを固定したまま、限られたラベル付きCOVID-19データでViTを微調整することで、過学習を防止する。
  • 重症度定量化には平均二乗誤差(MSE)を、診断にはバイナリクロスエントロピーを用い、データオーグメンテーションおよび機関間のデータ多様性を活用してモデルのロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1事前学習モデルから得られる低レベルのCXR特徴埋め込みは、COVID-19診断におけるビジョントランスフォーマーの有効なコーパスとして機能するか?
  • RQ2事前学習済み特徴コーパスを用いることで、標準的なViTやCNNベースラインと比較して、外部の未観測データセットにおける汎化性能が向上するか?
  • RQ3ROIプールの選択(マックスプール対平均プール)が、重症度定量化性能にどのように影響するか?
  • RQ4CXR画像のみを用いても、臨床的専門家と同等の重症度予測性能を達成できるか?
  • RQ5訓練時に多様な出典の機関データを含めることで、重症度定量化における汎化性能が顕著に向上するか?

主な発見

  • 提案モデルは、3つの外部データセットで平均重症度予測MSEが1.655を達成し、直接パッチ埋め込みを用いたベースラインViTやResNet特徴を用いたハイブリッドViTを上回った。
  • CNUH、YNU、KNUHの外部テストセットにおいて、それぞれMSEが1.682、1.677、1.607を記録し、優れた汎化性能を示した。
  • マックスプールを用いたROIプールによる重症度マップ集約は、平均プールと比較してMSEを0.191低下させ、局所的異常をより効果的に捉えられることを示した。
  • 訓練時に機関データを除外した場合、性能が著しく低下した(CNUHでのMSE = 2.503)、これは多様なデータの統合が安定した重症度予測に不可欠であることを確認した。
  • 診断と重症度定量化の両面で最先端の性能を達成し、重症度スコアリングにおいて臨床的専門家と同等の性能を示した。
  • 多数の機関にわたるモデルのロバスト性は、リソースが限られたまたは支援が不足している医療現場における実用的展開の可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。