[논문 리뷰] Laplacian-Former: Overcoming the Limitations of Vision Transformers in Local Texture Detection
Laplacian-Former는 라플라시안 피라미드를 사용하여 고주파 성분을 유지하는 방식으로, 효율적 주의 및 주파수 주의를 통합한 이중 주의 메커니즘을 내장한 새로운 트랜스포머 기반 아키텍처를 제안한다. 이는 국소 텍스처 검출을 향상시킨다. 다중 장기 및 피부 병변 세그멘테이션 벤치마크에서 각각 +1.87% 및 +0.76%의 Dice 스코어 향상을 기록하며, 사전 훈련 없이도 기존의 CNN 및 하이브리드 모델을 능가하는 최신 기술 수준의 성능을 달성한다.
Vision Transformer (ViT) models have demonstrated a breakthrough in a wide range of computer vision tasks. However, compared to the Convolutional Neural Network (CNN) models, it has been observed that the ViT models struggle to capture high-frequency components of images, which can limit their ability to detect local textures and edge information. As abnormalities in human tissue, such as tumors and lesions, may greatly vary in structure, texture, and shape, high-frequency information such as texture is crucial for effective semantic segmentation tasks. To address this limitation in ViT models, we propose a new technique, Laplacian-Former, that enhances the self-attention map by adaptively re-calibrating the frequency information in a Laplacian pyramid. More specifically, our proposed method utilizes a dual attention mechanism via efficient attention and frequency attention while the efficient attention mechanism reduces the complexity of self-attention to linear while producing the same output, selectively intensifying the contribution of shape and texture features. Furthermore, we introduce a novel efficient enhancement multi-scale bridge that effectively transfers spatial information from the encoder to the decoder while preserving the fundamental features. We demonstrate the efficacy of Laplacian-former on multi-organ and skin lesion segmentation tasks with +1.87\% and +0.76\% dice scores compared to SOTA approaches, respectively. Our implementation is publically available at https://github.com/mindflow-institue/Laplacian-Former
연구 동기 및 목표
- 의료 영상 세그멘테이션에 있어 중요한 엣지 및 텍스처와 같은 고주파 성분을 포착하지 못하는 비전 트랜스포머(ViT)의 한계를 해결하기 위해.
- 특히 종양 및 병변에서 미세한 텍스처 패턴을 검출하는 데 있어 CNN에 비해 열악한 국소 특징 표현을 보이는 ViT 모델의 문제를 해결하기 위해.
- CNN 기반 모델이나 무거운 사전 훈련에 의존하지 않고도 다중 척도 공간 및 주파수 정보를 유지하는 계산적으로 효율적인 순수 트랜스포머 기반 아키텍처를 설계하기 위해.
- 강화된 주파수 인식 주의 메커니즘을 통해 저대비, 고변동성이 특징인 의료 영상에서 경계 검출 및 세그멘테이션 정확도를 향상시키기 위해.
- 단일 트랜스포머 모델이 다중 장기 및 피부 병변 세그멘테이션 작업에서 하이브리드 및 CNN 기반 최신 기술 모델을 능가할 수 있음을 입증하기 위해.
제안 방법
- 자기주의 블록 내에 이중 주의 메커니즘을 제안: 출력 무결성을 유지하면서 복잡도를 제곱형에서 선형으로 줄이는 효율적 주의와 고주파 성분을 강조하는 주파수 주의를 결합.
- 라플라시안 피라미드 기반의 주파수 주의 모듈을 도입하여, 다양한 척도에서 텍스처 및 엣지 세부 정보를 강조함으로써 특징 맵을 적응적으로 재보정.
- 에코더에서 디코더로 공간 및 주파수 인식 특징을 전달하는 효율적인 다중 척도 브리지 모듈을 설계하여 미세한 세부 정보를 유지.
- 사전 훈련 없이 스타트에서 훈련하는 U-형 아키텍처를 사용하여 국소 및 글로벌 표현의 엔드 투 엔드 최적화를 가능하게 한다.
- 다중 척도 라플라시안 특징에 대해 작동하는 학습 가능한 주파수 주의 헤드를 도입하여 특징 공간 내에서 텍스처 관련 영역을 선택적으로 강화.
- 효율적 주의 메커니즘과 주파수 주의를 공유 주의 블록에 통합하여, 파rameter 효율적이고 고성능의 특징 학습을 가능하게 한다.

실험 결과
연구 질문
- RQ1순수 트랜스포머 기반 아키텍처가 의료 영상에서 국소 텍스처 및 엣지를 검출하는 데 있어 CNN 및 하이브리드 모델을 능가할 수 있는가?
- RQ2자기주의 메커니즘은 고주파 성분인 텍스처 및 엣지 정보를 더 잘 유지하기 위해 어떻게 수정될 수 있는가?
- RQ3라플라시안 피라미드를 주의 메커니즘에 통합할 경우 비전 트랜스포머의 국소 특징 표현에 어떤 영향을 미치는가?
- RQ4다중 척도 주파수 인식 주의 메커니즘이 다중 장기 및 피부 병변 세그멘테이션과 같은 도전적인 의료 영상 작업에서 성능 향상에 기여하는가?
- RQ5경량이고 효율적인 주의 메커니즘은 계산 복잡도를 줄이면서도 성능을 유지할 수 있는가?
주요 결과
- Synapse 다중 장기 세그멘테이션 벤치마크에서 Laplacian-Former는 HiFormer 및 Swin-Unet과 같은 모델을 능가하며, SOTA 방법 대비 +1.87%의 Dice 스코어 향상을 기록했다.
- ISIC 2018 피부 병변 세그멘테이션 데이터셋에서 Laplacian-Former는 0.9128의 Dice 스코어를 기록하여 Swin-Unet(0.8946)과 TMU-Net(0.9059)을 능가했으며, SOTA 대비 +0.76% 향상되었다.
- 제거 실험 결과, 다중 척도 브리지 모듈을 제거할 경우 Dice 스코어가 2.91% 감소하여, 공간 및 주파수 정보 유지에 있어 그 핵심적 역할을 확인했다.
- 스펙트럼 반응 분석 결과, 특히 깊은 층에서 표준 트랜스포머보다 Laplacian-Former가 고주파 성분을 더 잘 유지하는 것으로 확인되었다.
- 담낭, 간, 위와 같은 장기에서 뛰어난 경계 구분 능력을 보였으며, 췌장 세그멘테이션에서 거짓 양성 수치가 적었다.
- 사전 훈련 없이도 모든 베이스라인(사전 훈련된 모델 포함)을 능가함에 따라, 강력한 일반화 능력과 학습 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.