Skip to main content
QUICK REVIEW

[論文レビュー] Visual Transformer with Statistical Test for COVID-19 Classification

Chih–Chung Hsu, Guanlin Chen|arXiv (Cornell University)|Jul 12, 2021
COVID-19 diagnosis using AI参考文献 21被引用数 15
ひとこと要約

本稿では、肺部CTスキャンからのCOVID-19分類のための2次元および3次元ディープラーニングフレームワーク、DWCCおよびCCATを提案する。DWCCは、COVID-19を同定するために最も情報量の多いCTスライスを自動的に特定するためのディープ・ウィルコクソン符号順位検定を用いる。一方、CCATは、スライス内およびスライス間の両方のトランスフォーマーを備えた畳み込み型CTスキャン認識トランスフォーマーを採用し、空間的および時間的文脈をモデル化する。本手法は94.1%の正確性を達成し、最先端のモデルを著しく上回る性能を示した。

ABSTRACT

With the massive damage in the world caused by Coronavirus Disease 2019 SARS-CoV-2 (COVID-19), many related research topics have been proposed in the past two years. The Chest Computed Tomography (CT) scans are the most valuable materials to diagnose the COVID-19 symptoms. However, most schemes for COVID-19 classification of Chest CT scan is based on a single-slice level, implying that the most critical CT slice should be selected from the original CT scan volume manually. We simultaneously propose 2-D and 3-D models to predict the COVID-19 of CT scan to tickle this issue. In our 2-D model, we introduce the Deep Wilcoxon signed-rank test (DWCC) to determine the importance of each slice of a CT scan to overcome the issue mentioned previously. Furthermore, a Convolutional CT scan-Aware Transformer (CCAT) is proposed to discover the context of the slices fully. The frame-level feature is extracted from each CT slice based on any backbone network and followed by feeding the features to our within-slice-Transformer (WST) to discover the context information in the pixel dimension. The proposed Between-Slice-Transformer (BST) is used to aggregate the extracted spatial-context features of every CT slice. A simple classifier is then used to judge whether the Spatio-temporal features are COVID-19 or non-COVID-19. The extensive experiments demonstrated that the proposed CCAT and DWCC significantly outperform the state-of-the-art methods.

研究の動機と目的

  • 単一スライスCT分類の限界、すなわち、臨床的重要なスライスの手動選択に依存し、3次元的文脈を捉えられない点を是正すること。
  • 特にCOVID-19のような希少疾患において一般的に見られる低データ環境において、過学習を軽減し一般化性能を向上させること。
  • 空間的(ピクセルレベル)および時間的(スライスレベル)な文脈を両方活用する、計算効率的かつ強力な3次元モデルを構築すること。
  • 非パラメトリック統計的推論(ウィルコクソン検定)をディープラーニングに統合し、スライスの重要度順序付けの解釈可能性を向上させること。
  • COV19-CT-DBデータセットにおいて、既存の最先端手法を正確性、適合率、再現率、F1スコアの観点から上回ること。

提案手法

  • DWCCは、COVID-19の検出における統計的有意性に基づいてCTスライスをランク付けし、手動による干渉なしに最も情報量の多いスライスを自動選択できる。
  • CCATは、2本のブランチを持つトランスフォーマー構造を採用する:スライス内トランスフォーマー(WST)は各スライス内のピクセルレベルの文脈を捉え、スライス間トランスフォーマー(BST)は3次元ボリューム全体におけるスライス間関係をモデル化する。
  • モデルは各CTスライスからの初期特徴抽出にResNet-50バックボーンを用い、その後、WSTおよびBSTによる特徴処理によりスパatio-temporal表現学習を実現する。
  • 固定入力として16スライスを用い、周波数2でサンプリングし、トレーニング中にデータ拡張(ぼかし、ノイズ、コントラスト、明るさ、光の歪み)を適用する。
  • 個々のスライスではなく、3次元ボリューム全体に対してランダムクロッピングおよび回転処理を適用することで、スライスレベルの文脈の整合性を保持する。
  • DWCCとCCATのモデルアンサンブルによる多数決投票により性能が向上し、最高の評価指標が達成された。

実験結果

リサーチクエスチョン

  • RQ1ウィルコクソン符号順位検定のようなノンパラメトリック統計的検定をディープラーニングに効果的に統合することで、CTスキャンにおけるスライスレベルの重要度順序付けの解釈可能性と安定性を向上させることができるか?
  • RQ2ハイブリッドCNN-Transformerアーキテクチャは、3次元CTボリュームにおけるピクセルレベルおよびスライスレベルの文脈を効果的にモデル化し、COVID-19分類の性能を向上させることができるか?
  • RQ3提案されたCCATモデルは、COV19-CT-DBデータセットにおいて、既存の2次元および3次元ベースラインと比較して優れた性能を示すか、特に低データ環境下で?
  • RQ4アテンションヘッド数や入力スライス数といったハイパーパrameterは、CCATモデルの性能および一般化能力にどのように影響を与えるか?
  • RQ5統計的推論とディープラーニングを統合することで、小規模な医療画像データセットにおける過学習を軽減し、モデルの頑健性を向上させることができるか?

主な発見

  • 提案されたDWCCモデルは、91.9%の正確性、93.1%の適合率、91.1%の再現率、91.7%のF1スコアを達成し、ベースライン[8]および他の最先端モデルを著しく上回った。
  • CCATモデルは、93.3%の正確性、93.5%の適合率、92.9%の再現率、93.2%のF1スコアを達成し、既存の3次元および2次元手法を上回る優れた性能を示した。
  • DWCCとCCATのモデルアンサンブルは、94.1%の正確性、94.7%の適合率、93.5%の再現率、93.9%のF1スコアを達成し、最高の性能を示した。これは、両モデルの相補的な強みを示している。
  • ハイパーパrameterチューニングの結果、16枚の入力スライスおよび0個のアテンションヘッド(gMLPに相当)が最適であり、すべての指標で安定的かつ滑らかな訓練曲線が得られた。
  • 可視化結果から、モデルが、CTスキャンレベルのアノテーションのみでさえも、病変の顕著な領域を正しく局在化していることが確認された。これは、解釈可能性の向上を示している。
  • 本手法は、低データ環境下での過学習を効果的に軽減し、熟練医師による重要なスライスのアノテーション依存を低減し、完全に自動化され信頼性の高い分類を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。