[논문 리뷰] COVID-19 Detection in Chest X-ray Images Using Swin-Transformer and Transformer in Transformer
이 논문은 흉부 X선 영상의 세 가지 카테고리인 코로나19, 폐렴, 정상으로 분류하기 위해 Swin-Transformer와 Transformer in Transformer(TNT)을 조합한 하이브리드 딥러닝 접근법을 제안한다. 두 모델의 가중 평균 앙상블을 사용하여, Chest XR COVID-19 Detection Challenge 데이터셋에서 테스트 정확도 0.9475를 달성하였으며, 제한된 데이터와 계산 자원 조건에서도 비전 트랜스포머가 의료 영상 분류에 효과적임을 입증한다.
The Coronavirus Disease 2019 (COVID-19) has spread globally and caused serious damage. Chest X-ray images are widely used for COVID-19 diagnosis and the Artificial Intelligence method can increase efficiency and accuracy. In the Challenge of Chest XR COVID-19 detection in Ethics and Explainability for Responsible Data Science (EE-RDS) conference 2021, we proposed a method that combined Swin Transformer and Transformer in Transformer to classify chest X-ray images as three classes: COVID-19, Pneumonia, and Normal (healthy) and achieved 0.9475 accuracies on the test set.
연구 동기 및 목표
- 최신 비전 트랜스포머 아키텍처를 활용하여 흉부 X선 영상에서 코로나19 검출의 정확도와 효율성을 향상시키기 위해.
- 제한된 레이블이 부여된 데이터 상황에서 Swin-Transformer와 Transformer in Transformer의 의료 영상 분류 성능을 조사하기 위해.
- X선 영상 기반 조기 코로나19 검출을 위한 강건하고 설명 가능하며 책임감 있는 AI 솔루션을 개발하기 위해.
- 모델 앙상블 및 철저한 데이터 전처리를 통해 Chest XR COVID-19 Detection Challenge 벤치마크에서 높은 성능을 달성하기 위해.
제안 방법
- 흉부 X선 영상 내 국소적 및 전반적 종속성을 모델링하기 위해 계층적 특징 맵과 이동 윈도우 다중 머리 자기주의 주목적 Swin-Transformer(Swin-B)를 사용하였다.
- 패치를 '시각적 문장'으로 모델링하고, 이를 '시각적 단어'로 분할하여 표현 학습을 향상시키기 위해 Transformer in Transformer(TNT-S)를 통합하였다.
- 진단적 특징을 유지하기 위해 낮은 확률로 무작위 수평 반전, 소규모 범위의 회전/이동, 무작위 삭제를 포함한 데이터 증강 기법을 적용하였다.
- 사전 훈련된 ImageNet 모델과의 일치 및 계산 부담을 줄이기 위해 Swin-Transformer에는 224×224, TNT에는 384×384로 이미지 리사이징을 수행하였다.
- AdamW 옵timizer를 사용하여 두 모델을 훈련하였으며, 코스 인앙 학습률 스케줄링, 레이블 스무딩, 가중치 감소 0.05를 적용하였다.
- 최종 클래스 예측을 위해 예측 결과를 가중 평균 앙상블 전략으로 통합한 후 선형 분류기로 처리하였다.
실험 결과
연구 질문
- RQ1제한된 훈련 데이터로 Swin-Transformer와 Transformer in Transformer가 코로나19, 폐렴, 정상 카테고리로 흉부 X선 영상을 효과적으로 분류할 수 있는가?
- RQ2Chest XR 챌린지 데이터셋에서 Swin-Transformer와 TNT의 앙상블는 개별 모델 대비 정확도와 강건성 측면에서 어떻게 비교되는가?
- RQ3철저한 데이터 전처리 및 증강 기법이 과적합을 일으키지 않으면서도 의료 X선 영상에서 중요한 진단적 특징을 얼마나 잘 유지하는가?
- RQ4입력 해상도와 모델 아키텍처 선택이 저자원 의료 영상 분석 환경에서 성능에 미치는 영향은 어느 정도인가?
- RQ5비전 트랜스포머가 코로나19 X선 영상에서 미세한 폐 질환 패atters를 탐지하는 데 기존의 CNN 기반 모델보다 우월한가?
주요 결과
- 앙상블 모델은 테스트 정확도 0.9475를 기록하여 공식 챌린지 랭킹에서 10위를 차지하였다.
- 민감도와 특이도 점수가 모두 0.94 초과로, 양성 및 음성 케이스를 정확히 식별하는 데 강력한 성능을 보였다.
- Swin-Transformer와 TNT에 2:1의 가중치 비율을 적용한 모델이 가장 높은 정확도(0.9475)를 기록하였으며, 동일 가중치 및 개별 모델 결과를 모두 초월하였다.
- Swin-Transformer 모델 자체는 0.9467의 정확도를 기록하였고, TNT 모델의 단독 성능은 보고되지 않았지만 앙상블 성능 향상에 기여하였다.
- 최소한이면서도 파괴적이지 않은 데이터 증강 기법을 통해 질병 특징을 식별하는 데 핵심적인 특징들이 유지되었다.
- 계산 자원 제약에도 불구하고, 이 접근법은 비전 트랜스포머가 저자원 의료 영상 작업에서 높은 성능을 달성할 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.