[논문 리뷰] TESL-Net: A Transformer-Enhanced CNN for Accurate Skin Lesion Segmentation
TESL-Net는 CNN 인코더-디코더와 스위니 트랜스포머 블록, 양방향 컨볼루션 리커런트 신경망(Bi-ConvLSTM) 모듈을 융합한 하이브리드 딥 러닝 아키텍처를 제안하여 피부 병변 분할 성능을 향상시킨다. 스위치포머를 통한 전역적 맥락 통합과 스킵 연결 내 Bi-ConvLSTM를 통한 순차적 모델링을 통해, ISIC 2017 및 ISIC 2018 데이터셋에서 Jaccard 지수 기준 기존 최고 성능(SOTA) 방법보다 최대 11.22% 향상된 최신 기술 수준의 성능을 달성한다.
Early detection of skin cancer relies on precise segmentation of dermoscopic images of skin lesions. However, this task is challenging due to the irregular shape of the lesion, the lack of sharp borders, and the presence of artefacts such as marker colours and hair follicles. Recent methods for melanoma segmentation are U-Nets and fully connected networks (FCNs). As the depth of these neural network models increases, they can face issues like the vanishing gradient problem and parameter redundancy, potentially leading to a decrease in the Jaccard index of the segmentation model. In this study, we introduced a novel network named TESL-Net for the segmentation of skin lesions. The proposed TESL-Net involves a hybrid network that combines the local features of a CNN encoder-decoder architecture with long-range and temporal dependencies using bi-convolutional long-short-term memory (Bi-ConvLSTM) networks and a Swin transformer. This enables the model to account for the uncertainty of segmentation over time and capture contextual channel relationships in the data. We evaluated the efficacy of TESL-Net in three commonly used datasets (ISIC 2016, ISIC 2017, and ISIC 2018) for the segmentation of skin lesions. The proposed TESL-Net achieves state-of-the-art performance, as evidenced by a significantly elevated Jaccard index demonstrated by empirical results.
연구 동기 및 목표
- 불규칙한 형태, 흐린 경계, 머리카락 및 마커 색상 등의 아티팩트로 인해 도마뱀 피부 영상에서 정밀한 피부 병변 분할을 수행하는 데 도전하는 문제를 해결한다.
- 기울어짐 기울기와 파rameter 중복성 등의 문제로 인해 분할 성능이 저하되는 딥 컨볼루션 신경망(CNN)의 한계를 극복한다.
- 장거리 상관관계와 시간적 모델링을 U-Net 유사 아키텍처에 통합하여 특징 표현을 향상시킨다.
- CNN, 스위니 트랜스포머, Bi-ConvLSTM 구성 요소의 새로운 융합을 통해 기준 데이터셋(ISIC 2016, 2017, 2018)에서 분할 정확도를 향상시킨다.
- 다양한 공개 피부 병변 분할 기준 데이터셋에서 Jaccard 지수, Dice 스코어 및 기타 지표에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 특징 학습 및 분할을 위한 기초로 U-Net 스타일의 인코더-디코더 아키텍처를 사용한다.
- 장거리 맥락적 관계와 전역 이미지 의존성을 포착하기 위해 인코더에 스위니 트랜스포머 블록을 통합한다.
- 특징 맵 간 순차적 및 공간-시간적 의존성을 모델링하기 위해 스킵 연결에 Bi-ConvLSTM 모듈을 삽입한다.
- 다중 척도 특징 융합 및 스킵 연결을 활용하여 공간 세부 정보를 유지하면서 의미 표현을 강화한다.
- 스위니 트랜스포머 내 다중 헤드 자기주의 메커니즘을 활용하여 국소 및 전역 수용 영역에서 특징 중요도를 동적으로 가중한다.
- 피부 병변 경계에서의 분할 성능 최적화를 위해 이진 교차 엔트로피 손실과 Dice 손실을 함께 사용하여 엔드 투 엔드 모델을 훈련시킨다.

실험 결과
연구 질문
- RQ1CNN, 트랜스포머, Bi-ConvLSTM를 융합한 하이브리드 아키텍처가 표준 U-Net 및 SOTA 모델 대비 피부 병변 분할 정확도를 향상시킬 수 있는가?
- RQ2스위니 트랜스포머 블록의 통합이 복잡한 무늬와 아티팩트를 포함한 도마뱀 피부 영상에서 장거리 맥락적 특징을 효과적으로 포착하는 데 얼마나 유용한가?
- RQ3스킵 연결 내 Bi-ConvLSTM 모듈이 특징 맵 간 시간적 및 공간적 의존성을 모델링함으로써 특징 표현을 얼마나 향상시키는가?
- RQ4제안된 TESL-Net 아키텍처는 다양한 병변 형태, 대비, 아티팩트 존재 여부를 가진 다양한 피부 병변 데이터셋에 일반화되는가?
- RQ5국소(CNN), 전역(트랜스포머), 순차적(Bi-ConvLSTM) 모델링의 융합이 Jaccard 지수 및 Dice 스코어와 같은 표준 평가 지표에서 뛰어난 성능을 내는가?
주요 결과
- TESL-Net는 ISIC 2017 데이터셋에서 Jaccard 지수(IoU) 86.91%를 기록하여 이전 SOTA 방법(RA-Net)보다 2.02% 높은 성능을 보였다.
- ISIC 2018 데이터셋에서는 Jaccard 지수 90.56%를 기록하여 다음으로 우수한 방법(RA-Net)보다 2.22% 높은 성능을 보였다.
- ISIC 2018에서 TESL-Net는 Dice 스코어 94.22%를 기록하여 예측된 분할 마스크와 진짜 마스크 간의 높은 겹침을 보였다.
- ISIC 2016 벤치마크에서 TESL-Net는 SOTA 방법보다 Jaccard 지수 8.13% 높게 기록하여 다양한 데이터셋에서의 일관된 우수성을 확인했다.
- 시각적 비교 결과, TESL-Net는 불규칙한 병변 형태, 낮은 대비, 머리카락 및 잉크 아티팩트와 같은 어려운 케이스를 효과적으로 처리하는 것으로 나타났다.
- ISIC 2017에서 TESL-Net는 특이도 97.29%를 기록했고, ISIC 2018에서는 97.21%를 기록하여 건강한 피부 영역를 정확히 식별하는 데 강력한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.