[논문 리뷰] Visual Transformer with Statistical Test for COVID-19 Classification
이 논문은 흉부 CT 영상에서 코로나19 분류를 위한 2차원 및 3차원 딥러닝 프레임워크인 DWCC와 CCAT을 제안한다. DWCC는 깊이 있는 윌코크슨 서열검정을 사용하여 가장 정보가 풍부한 CT 슬라이스를 자동으로 식별하며, CCAT은 슬라이스 내 및 슬라이스 간 트랜스포머를 활용하여 공간적 및 시간적 맥락을 모델링하는 컨볼루션 CT 스캔 인식 트랜스포머를 적용한다. 이 방법은 94.1%의 정확도를 달성하여 최신 기술 수준의 모델들을 크게 앞서며 성능을 발휘한다.
With the massive damage in the world caused by Coronavirus Disease 2019 SARS-CoV-2 (COVID-19), many related research topics have been proposed in the past two years. The Chest Computed Tomography (CT) scans are the most valuable materials to diagnose the COVID-19 symptoms. However, most schemes for COVID-19 classification of Chest CT scan is based on a single-slice level, implying that the most critical CT slice should be selected from the original CT scan volume manually. We simultaneously propose 2-D and 3-D models to predict the COVID-19 of CT scan to tickle this issue. In our 2-D model, we introduce the Deep Wilcoxon signed-rank test (DWCC) to determine the importance of each slice of a CT scan to overcome the issue mentioned previously. Furthermore, a Convolutional CT scan-Aware Transformer (CCAT) is proposed to discover the context of the slices fully. The frame-level feature is extracted from each CT slice based on any backbone network and followed by feeding the features to our within-slice-Transformer (WST) to discover the context information in the pixel dimension. The proposed Between-Slice-Transformer (BST) is used to aggregate the extracted spatial-context features of every CT slice. A simple classifier is then used to judge whether the Spatio-temporal features are COVID-19 or non-COVID-19. The extensive experiments demonstrated that the proposed CCAT and DWCC significantly outperform the state-of-the-art methods.
연구 동기 및 목표
- 단일 슬라이스 CT 분류의 한계를 해결하기 위해, 핵심 슬라이스를 수동으로 선택하는 데 의존하고 3차원 맥락을 포착하지 못하는 문제를 해결하고자 한다.
- 특히 코로나19와 같은 희귀 질환에서 흔히 발생하는 저자료 환경에서 과적합을 줄이고 일반화 능력을 향상시키고자 한다.
- 공간적(픽셀 수준) 및 시간적(슬라이스 수준) 맥락을 모두 활용하면서도 계산 효율적이면서도 강력한 3차원 모델을 개발하고자 한다.
- 비모수 통계적 추론(윌코크슨 검정)을 딥러닝에 통합하여 슬라이스 중요도 순위 매기기의 해석 가능성과 안정성을 향상시키고자 한다.
- COV19-CT-DB 데이터셋에서 기존 최신 기술 수준의 방법들보다 정확도, 정밀도, 재현율 및 F1 점수에서 뛰어난 성능을 달성하고자 한다.
제안 방법
- DWCC는 코로나19 검출에서의 통계적 유의성에 따라 CT 슬라이스를 순위 매김함으로써 수동 간섭 없이 가장 정보가 풍부한 슬라이스를 자동으로 선별한다.
- CCAT는 이중 브랜치 트랜스포머 아키텍처를 사용한다: 슬라이스 내 트랜스포머(WST)는 각 슬라이스 내의 픽셀 수준 맥락을 캡처하고, 슬라이스 간 트랜스포머(BST)는 3차원 볼륨 전체의 슬라이스 간 관계를 모델링한다.
- 모델은 각 CT 슬라이스에서 초기 특징을 추출하기 위해 ResNet-50 백본을 사용하며, 이후 WST와 BST를 통해 공간-시간 표현 학습을 수행한다.
- 고정된 16개의 슬라이스 입력을 사용하며, 샘플링 주파수는 2이다. 학습 중 데이터 증강(흐림, 노이즈, 대비, 밝기, 광학 왜곡)이 적용된다.
- 개별 슬라이스가 아닌 전체 3차원 볼륨에 대해 무작위 자르기 및 회전을 적용하여 슬라이스 수준의 맥락 무결성을 유지한다.
- DWCC와 CCAT 간 다수결정 방식의 앙상블 모델링을 통해 성능을 향상시켜 최고의 평가 지표를 달성한다.
실험 결과
연구 질문
- RQ1윌코크슨 서열검정과 같은 비모수 통계적 검정이 딥러닝에 효과적으로 통합될 수 있는가? 이를 통해 CT 영상에서 슬라이스 수준의 중요도 순위 매기기의 해석 가능성과 안정성이 향상되는가?
- RQ2하이브리드 CNN-트랜스포머 아키텍처가 3차원 CT 볼륨에서 픽셀 수준 및 슬라이스 수준의 맥락을 효과적으로 모델링할 수 있는가?
- RQ3제안된 CCAT 모델이 COV19-CT-DB 데이터셋에서 기존 2차원 및 3차원 기준 모델들보다 뛰어난 성능을 보일 수 있는가? 특히 저자료 환경에서의 성능이 뛰어난가?
- RQ4어 attention 헤드 수와 입력 슬라이스 수와 같은 하이퍼파rameter가 CCAT 모델의 성능 및 일반화 능력에 미치는 영향은 어떠한가?
- RQ5딥러닝에 통계적 추론을 통합함으로써 저자료 의료 영상 데이터셋에서 과적합을 줄이고 모델의 강건성을 향상시킬 수 있는가?
주요 결과
- 제안된 DWCC 모델은 91.9%의 정확도, 93.1%의 정밀도, 91.1%의 재현율, 91.7%의 F1 점수를 기록하여 기준 모델 [8] 및 기타 최신 기술 수준의 모델들을 크게 앞서는 성능을 보였다.
- CCAT 모델은 93.3%의 정확도, 93.5%의 정밀도, 92.9%의 재현율, 93.2%의 F1 점수를 기록하여 기존 3차원 및 2차원 방법들보다 뛰어난 성능을 입증했다.
- DWCC와 CCAT의 앙상블 모델은 94.1%의 정확도, 94.7%의 정밀도, 93.5%의 재현율, 93.9%의 F1 점수를 기록하여 최고의 성능을 달성하였으며, 상호보완적인 강점을 보였다.
- 하이퍼파라미터 튜닝 결과, 16개의 입력 슬라이스와 0개의 어텐션 헤드(즉, gMLP에 해당)에서 최적의 성능을 기록하였으며, 모든 지표에서 안정적이고 매끄러운 학습 곡선을 보였다.
- 시각화 결과는 모델이 단지 CT 스캔 수준의 레이블만으로도 병적 영역을 정확히 국소화함을 확인하였으며, 이는 해석 가능성 향상을 의미한다.
- 이 방법은 저자료 환경에서의 과적합을 효과적으로 완화하고 전문가가 주석 처리한 핵심 슬라이스에 대한 의존도를 줄여, 완전히 자동화되고 신뢰할 수 있는 분류를 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.