Skip to main content
QUICK REVIEW

[論文レビュー] SwinCheX: Multi-label classification on chest X-ray images with transformers

Sina Taslimi, Soroush Taslimi|arXiv (Cornell University)|Jun 9, 2022
COVID-19 diagnosis using AI被引用数 15
ひとこと要約

本稿では、バックボーンにSwin変換器を用い、マルチラベル分類のためのマルチレイヤーパーセプトロン(MLP)ヘッドを備えた、胸部X線画像向けのマルチラベル分類モデルであるSwinCheXを提案する。3層のMLPヘッドを用いることで、ChestX-ray14データセットにおいてSOTAを達成し、平均AUCが0.810に達し、以前のSOTA(0.799)を上回った。

ABSTRACT

According to the considerable growth in the avail of chest X-ray images in diagnosing various diseases, as well as gathering extensive datasets, having an automated diagnosis procedure using deep neural networks has occupied the minds of experts. Most of the available methods in computer vision use a CNN backbone to acquire high accuracy on the classification problems. Nevertheless, recent researches show that transformers, established as the de facto method in NLP, can also outperform many CNN-based models in vision. This paper proposes a multi-label classification deep model based on the Swin Transformer as the backbone to achieve state-of-the-art diagnosis classification. It leverages Multi-Layer Perceptron, also known as MLP, for the head architecture. We evaluate our model on one of the most widely-used and largest x-ray datasets called "Chest X-ray14," which comprises more than 100,000 frontal/back-view images from over 30,000 patients with 14 famous chest diseases. Our model has been tested with several number of MLP layers for the head setting, each achieves a competitive AUC score on all classes. Comprehensive experiments on Chest X-ray14 have shown that a 3-layer head attains state-of-the-art performance with an average AUC score of 0.810, compared to the former SOTA average AUC of 0.799. We propose an experimental setup for the fair benchmarking of existing methods, which could be used as a basis for the future studies. Finally, we followed up our results by confirming that the proposed method attends to the pathologically relevant areas of the chest.

研究の動機と目的

  • ビジョン変換器を用いた胸部X線画像のマルチラベル分類のためのディーブラーニングモデルの開発。
  • 従来のCNNベースおよび変換器ベースのモデルを上回る性能を、ChestX-ray14データセットで実現すること。
  • 患者単位のデータ分割を用いた公平なベンチマークプロトコルの確立。
  • 病変に関連する領域への注目度を、注視マップの分析により解釈可能性を検証すること。
  • Swinのようなマルチスケール変換器が、マルチラベルCXR診断において従来のCNNよりも優れていることを示すこと。

提案手法

  • 事前学習済みSwin変換器を胸部X線画像の特徴抽出器として適応する。
  • 深さが異なる(1〜3層)マルチヘッドフィードフォワードニューラルネットワーク(MLP)を分類ヘッドとして採用する。
  • データ漏洩を防ぐために、患者単位の訓練/検証/テスト分割を用いてChestX-ray14データセット上でモデルをエンドツーエンドで訓練する。
  • Grad-CAMを用いてサリエンシー熱マップを生成し、疾患関連解剖的領域への注目度を検証する。
  • 過去の手法と公平に比較できるよう、標準化された評価プロトコルを適用し、DNetについても同じ分割条件下での再評価を実施する。
  • 適応的学習率を用いないことで、ハイパーパrameterの複雑さと過学習のリスクを低減する。

実験結果

リサーチクエスチョン

  • RQ1Swin変換器のようなビジョン変換器は、マルチラベル胸部X線画像分類において、CNNベースのモデルを上回ることができるか?
  • RQ2胸部X線画像のマルチラベル分類において、MLPヘッドの最適な深さは何か?
  • RQ3標準化された患者単位のデータ分割は、モデル評価の性能と公平性にどのように影響するか?
  • RQ4提案手法は、Grad-CAMによって確認されたように、病変関連領域(例:不張変化では肺底、腫瘍では右肺、心臓拡大では心臓境界)に注目しているか?
  • RQ5適応的学習率を用いないシンプルなトレーニング設定でも、SOTA性能を達成できるか?

主な発見

  • SwinCheXにおける3層MLPヘッドは、ChestX-ray14データセットで平均AUC 0.810を達成し、新たなSOTAを樹立した。
  • 同じ評価プロトコル下で評価した場合、DNetの平均AUC(0.799)を0.011上回った。
  • Grad-CAMの可視化により、不張変化では肺底、腫瘍では右肺、心臓拡大では心臓境界といった疾患関連領域にモデルが注目していることが確認された。
  • 14の病変すべてにおいて優れた性能を維持しており、心臓拡大、ヘルニア、浸出液の3つを除き、DNetがわずかに優位であったが、これは限定的であった。
  • 提案された公平なベンチマークプロトコルで再評価したところ、DNetの平均AUCは0.799に低下し、一貫性のある評価の重要性が裏付けられた。
  • SwinCheXでは適応的学習率を用いないことで、トレーニングが簡素化され、過学習のリスクも低減されたが、優れた性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。