Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Vision Transformer with Residual in Self-attention for Biomedical Image Classification

Arun Sharma, Nishchal K. Verma|arXiv (Cornell University)|2023. 06. 02.
Brain Tumor Detection and Classification인용 수 4
한 줄 요약

이 논문은 다중 헤드 자기주의 잔차 연결을 갖춘 새로운 비전 트랜스포머(ViT) 아키텍처를 제안한다. 여기서 가장 좋은 주의 헤드는 주의 점수의 L1 노름을 통해 선택되며, 이는 최종 출력에 잔차로 추가된다. 이 방법은 생물의학 영상 분류에서 특징 표현을 향상시키며, 혈액세포 영상에서 93.38%의 정확도와 뇌 MRI 종양 탐지에서 96.15%의 정확도를 달성하여 표준 ViT 및 컨volutional SOTA 모델을 능가한다.

ABSTRACT

Biomedical image classification requires capturing of bio-informatics based on specific feature distribution. In most of such applications, there are mainly challenges due to limited availability of samples for diseased cases and imbalanced nature of dataset. This article presents the novel framework of multi-head self-attention for vision transformer (ViT) which makes capable of capturing the specific image features for classification and analysis. The proposed method uses the concept of residual connection for accumulating the best attention output in each block of multi-head attention. The proposed framework has been evaluated on two small datasets: (i) blood cell classification dataset and (ii) brain tumor detection using brain MRI images. The results show the significant improvement over traditional ViT and other convolution based state-of-the-art classification models.

연구 동기 및 목표

  • 딥 러닝에서 제한적이고 불균형한 생물의학 영상 데이터셋 문제를 해결하기 위해.
  • 의료 영상 분류를 위한 비전 트랜스포머에서 특징 표현과 일반화 능력을 향상시키기 위해.
  • 주어진 주의 점수의 L1 노름을 기반으로 가장 정보가 풍부한 주의 헤드를 선택하는 다중 헤드 자기주의에 잔차 메커니즘을 도입하기 위해.
  • 소규모 생물의학 영상 데이터셋에서 모델의 강건성 향상과 과적합 감소를 위해.
  • 두 가지 생물의학 영상 분류 벤치마크에서 표준 ViT 및 최신 기술 기반 CNN 모델보다 뛰어난 성능을 입증하기 위해.

제안 방법

  • 제안된 방법은 각 다중 헤드 주의 헤드에서 주의 점수의 L1 노름(맨하탄 노름)을 계산한다.
  • 가장 높은 L1 노름을 가진 주의 헤드가 '최고의 헤드'로 선정되며, 이는 가장 정보가 풍부한 주의 패턴을 나타낸다.
  • 이 최고의 헤드의 출력은 선형 투영 레이어 이후 최종 투영된 주의 출력에 잔차 연결으로 추가된다.
  • 이 잔차 연결은 최종 표현에 가장 분류에 유용한 주의 특징을 통합함으로써 특징 학습을 향상시킨다.
  • 수정된 주의 블록은 사전 훈련된 ViT-base 모델에 통합된 후 생물의학 영상 데이터셋에서 미세조정된다.
  • 이 방법은 낮은 오버헤드의 정렬 및 노름 연산 덕분에 계산 효율성이 유지되며, 표준 ViT와 거의 동일한 복잡도를 유지한다.

실험 결과

연구 질문

  • RQ1주어진 주의 점수의 L1 노름을 통해 가장 정보가 풍부한 주의 헤드를 선택하는 것이 소규모 생물의학 영상 데이터셋에서 ViT 성능 향상에 기여하는가?
  • RQ2최고의 주의 헤드를 잔차 연결으로 통합하는 것이 특징 표현과 분류 정확도 향상에 기여하는가?
  • RQ3제안된 ViT 변종은 불균형한 생물의학 영상 데이터에서 표준 ViT 및 최신 기술 기반 CNN 모델과 비교해 정확도와 일반화 능력 측면에서 어떻게 성능을 내는가?
  • RQ4잔차 메커니즘이 제한된 훈련 데이터에서 과적합을 줄이고 일반화 능력을 향상시키는가?
  • RQ5제안된 주의 메커니즘은 혈액세포 분류 및 뇌 종양 탐지와 같은 다양한 생물의학 영상 작업에 효과적으로 적용될 수 있는가?

주요 결과

  • 제안된 ViT는 혈액세포 분류 데이터셋에서 93.38%의 정확도를 기록하여 다음으로 우수한 모델인 ViT(88.38%)를 크게 앞섰다.
  • 뇌 MRI 종양 탐지 데이터셋에서 제안된 방법은 96.15%의 정확도를 달성하여 표준 ViT(92.15%)와 ResNet18(92.16%)를 모두 초월했다.
  • 혈액세포 데이터셋에서의 F1 점수는 0.94로, 표준 ViT의 0.89와 비교해 정밀도와 재현율의 균형이 뛰어나다는 것을 보여주었다.
  • 훈련 및 검증 정확도 곡선 간 격차가 감소하여 일반화 능력 향상과 과적합 감소를 시사했다.
  • 혼동 행렬 분석 결과, 제안된 모델은 두 데이터셋 모두에서 사전 훈련된 ViT 기준선 대비 더 적은 오분류를 보였다.
  • 복잡도 분석 결과, 이 방법은 최소한의 계산 오버헤드를 추가하며, 표준 ViT와 동일한 O(n²d) 복잡도를 유지함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.