Skip to main content
QUICK REVIEW

[논문 리뷰] HiFuse: Hierarchical Multi-Scale Feature Fusion Network for Medical Image Classification

Xiangzuo Huo, Gang Sun|arXiv (Cornell University)|2022. 09. 21.
Brain Tumor Detection and Classification인용 수 16
한 줄 요약

HiFuse는 의료 영상 분류를 위해 CNN과 Transformer의 장점을 융합하는 삼지망 계층적 다중스케일 특징 융합 네트워크를 제안한다. 병렬로 구현된 국소 및 전역 특징 블록과 스케일 인식 융합을 위한 적응형 HFF 블록을 사용함으로써 선형 계산 복잡도를 유지하면서 최신 기술 수준의 정확도를 달성하였으며, 코로나19 데이터셋에서 기준 모델 대비 최대 21.5% 향상된 성능을 보였다.

ABSTRACT

Medical image classification has developed rapidly under the impetus of the convolutional neural network (CNN). Due to the fixed size of the receptive field of the convolution kernel, it is difficult to capture the global features of medical images. Although the self-attention-based Transformer can model long-range dependencies, it has high computational complexity and lacks local inductive bias. Much research has demonstrated that global and local features are crucial for image classification. However, medical images have a lot of noisy, scattered features, intra-class variation, and inter-class similarities. This paper proposes a three-branch hierarchical multi-scale feature fusion network structure termed as HiFuse for medical image classification as a new method. It can fuse the advantages of Transformer and CNN from multi-scale hierarchies without destroying the respective modeling so as to improve the classification accuracy of various medical images. A parallel hierarchy of local and global feature blocks is designed to efficiently extract local features and global representations at various semantic scales, with the flexibility to model at different scales and linear computational complexity relevant to image size. Moreover, an adaptive hierarchical feature fusion block (HFF block) is designed to utilize the features obtained at different hierarchical levels comprehensively. The HFF block contains spatial attention, channel attention, residual inverted MLP, and shortcut to adaptively fuse semantic information between various scale features of each branch. The accuracy of our proposed model on the ISIC2018 dataset is 7.6% higher than baseline, 21.5% on the Covid-19 dataset, and 10.4% on the Kvasir dataset. Compared with other advanced models, the HiFuse model performs the best. Our code is open-source and available from https://github.com/huoxiangzuo/HiFuse.

연구 동기 및 목표

  • 의료 영상에서의 내부 클래스 변동성과 외부 클래스 유사성 문제를 해결하기 위해 전역 및 국소 특징을 효과적으로 융합한다.
  • 의료 영상에 적용할 때 CNN의 고정된 수신장과 Transformer의 자기주의 주의로 인한 높은 계산 비용 문제를 극복한다.
  • 깊은 네트워크 없이도 고성능을 유지하면서도 확장 가능하고 효율적인 아키텍처를 설계한다. 기울기 소실 및 특징 손실을 방지한다.
  • 국소 및 전역 브랜치에서 유도된 다중스케일 의미 표현을 통합하여 다양한 의료 영상 데이터셋에서의 분류 정확도를 향상시킨다.

제안 방법

  • 다양한 스케일의 공간적 및 의미적 표현을 추출하기 위해 국소 및 전역 특징 블록을 전용으로 갖춘 삼지망 병렬 아키텍처를 제안한다.
  • 공간 주의, 채널 주의, 잔여 역전형 MLP, 스킵 연결을 융합한 적응형 계층적 특징 융합(HFF) 블록을 도입하여 스케일별 특징 융합을 수행한다.
  • 계층적 설계를 통해 다양한 의미 스케일에서의 탌성 있는 모델링이 가능하며, 이미지 크기와 선형 계산 복잡도를 유지한다.
  • 백본으로 ConvNeXt를 사용하고, 스위프트 트랜스포머 기반의 블록을 통합하여 국소 인덕티브 바이어스와 장거리 의존성 모델링을 균형 있게 구현한다.
  • 오버피팅을 제어하고 소규모 의료 영상 데이터셋에서 최적의 성능을 확보하기 위해 드롭 패스 정규화와 깊이 스케일링을 적용한다.
  • 표준화된 데이터 분할과 2중 교차 검증을 사용하여 ISIC2018, 코로나19, Kvasir 등의 데이터셋 간 공정한 비교를 보장한다.

실험 결과

연구 질문

  • RQ1국소 CNN과 전역 트랜스포머 특징을 융합하는 계층적 다중스케일 융합 프레임워크가 의료 영상 분류 정확도 향상에 기여할 수 있는가?
  • RQ2기본적인 연결 또는 원소별 연산 대비 제안된 HFF 블록이 다양한 의미 스케일 간 특징 융합에 어떻게 기여하는가?
  • RQ3다양한 크기와 모odal 특성을 지닌 다양한 의료 영상 데이터셋에 대해 HiFuse가 얼마나 일반화되는가?
  • RQ4특히 소규모 의료 영상 데이터셋에서 깊이를 줄이고 선형 복잡도를 유지함으로써 높은 성능을 유지를 할 수 있는가?

주요 결과

  • HiFuse는 ISIC2018 데이터셋에서 기준 모델 대비 7.6% 높은 정확도를 기록하여 피부 병변 분류에서 뚜렷한 향상을 보였다.
  • 코로나19 데이터셋에서 HiFuse는 기준 모델 대비 21.5% 높은 성능을 기록하여 소규모이고 노이즈가 많은 의료 영상 컬렉션에서 강력한 성능을 입증했다.
  • HiFuse-Small는 Kvasir 데이터셋에서 85.00%의 정확도와 84.96%의 F1 스코어를 기록하여 Conformer 및 Swin-B를 포함한 모든 비교 모델을 초월했다.
  • HiFuse-Base 버전은 깊이 증가로 인해 정확도가 약간 감소하여 얕은 구성에서 최적의 성능 달성이 가능함을 시사했다.
  • 모델은 이미지 크기와 선형 계산 복잡도를 유지하여 정확도를 희생시키지 않은 채 효율적인 추론이 가능했다.
  • 실험 결과, 깊이-얕은 특징과 전역-국소 특징을 모두 캡처하는 것이 의료 영상 작업에서 분류 성능 향상에 크게 기여한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.