[論文レビュー] COVID-19 Detection in Chest X-ray Images Using Swin-Transformer and Transformer in Transformer
本論文は、胸部X線画像をCOVID-19、肺炎、正常の3つのカテゴリに分類するためのハイブリッドディープラーニングアプローチを提案している。2つのモデルの重み付きアンサンブル平均を用いることで、Chest XR COVID-19 Detection Challengeデータセットにおいてテスト精度0.9475を達成し、限られたデータと計算リソースの制約下でも、ビジョントランスフォーマーが医療画像分類において有効であることを示している。
The Coronavirus Disease 2019 (COVID-19) has spread globally and caused serious damage. Chest X-ray images are widely used for COVID-19 diagnosis and the Artificial Intelligence method can increase efficiency and accuracy. In the Challenge of Chest XR COVID-19 detection in Ethics and Explainability for Responsible Data Science (EE-RDS) conference 2021, we proposed a method that combined Swin Transformer and Transformer in Transformer to classify chest X-ray images as three classes: COVID-19, Pneumonia, and Normal (healthy) and achieved 0.9475 accuracies on the test set.
研究の動機と目的
- 最新のビジョントランスフォーマー・アーキテクチャを用いて、限られたデータと計算リソースの制約下でも、胸部X線画像におけるCOVID-19検出の精度と効率を向上させること。
- 限られたアノテーション付きデータを用いた医療画像分類の文脈において、Swin-TransformerとTransformer in Transformerの性能を調査すること。
- X線画像を用いたCOVID-19の早期検出に向け、強固で説明可能かつ責任あるAIソリューションを構築すること。
- モデルアンサンブルと慎重なデータ前処理を通じて、Chest XR COVID-19 Detection Challengeベンチマークで高い性能を達成すること。
提案手法
- 局所的およびグローバルな依存関係をモデル化するため、階層的特徴マップとシフトドウインドウマルチヘッド自己注意機構を備えたSwin-Transformer(Swin-B)を採用し、胸部X線画像に適用した。
- パッチを「視覚的文」としてモデル化し、それらをさらに「視覚的語」に分割することで、表現学習を強化するTransformer in Transformer(TNT-S)を統合した。
- 診断的特徴を損なわないように、ランダムな水平反転、小範囲の回転・平行移動、低確率でのランダムエラージングを含むデータオーグメンテーション技術を適用した。
- 事前学習済みImageNetモデルとの整合性を保ちつつ計算負荷を管理するため、Swin-Transformerには224×224、TNTには384×384のサイズに画像をリサイズした。
- AdamW最適化法を用い、コサインスケジューリングによる学習率スケーリング、ラベルスムージング、0.05の重み減衰を適用して両モデルを訓練した。
- 予測結果を重み付き平均アンサンブル戦略で統合し、最終的な分類予測のために線形分類器を適用した。
実験結果
リサーチクエスチョン
- RQ1限られた学習データを用いて、Swin-TransformerとTransformer in Transformerは、胸部X線画像をCOVID-19、肺炎、正常の3クラスに効果的に分類できるか?
- RQ2Chest XRチャレンジデータセットにおいて、Swin-TransformerとTNTのアンサンブルは、個々のモデルと比較して、精度と頑健性に優れているか?
- RQ3慎重なデータ前処理とオーグメンテーションは、過学習を防ぎつつ、医療X線画像の重要な診断的特徴をどの程度保持できるか?
- RQ4入力解像度とモデルアーキテクチャの選択が、低データ医療画像認識のシナリオにおいて性能に与える影響は何か?
- RQ5視覚トランスフォーマーは、COVID-19X線画像における微細な肺徴候を検出する際に、従来のCNNベースのモデルを上回ることができるか?
主な発見
- アンサンブルモデルはテスト精度0.9475を達成し、公式チャレンジリーダーボードで10位を記録した。
- 感度と特異度のスコアともに0.94を超えており、陽性および陰性の症例を正確に同定していることを示している。
- Swin-TransformerとTNTに2:1の重み比を設定したモデルが最高の精度(0.9475)を達成し、等重みや個別モデルの結果を上回った。
- Swin-Transformer単体では0.9467の精度を達成したが、TNT単体の結果は報告されていないが、アンサンブル性能に寄与した。
- 最小限で破壊的でないデータオーグメンテーションにより、医療診断に不可欠なクラス判別的特徴が保持された。
- 計算リソースの制約が存在する中でも、本アプローチはビジョントランスフォーマーが低リソース医療画像認識タスクで高い性能を発揮できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。