[논문 리뷰] LViT: Language meets Vision Transformer in Medical Image Segmentation
LViT는 의료 텍스트 애너테이션을 통합하여 저자원 및 준감독 설정에서 의료 영상 분할 성능을 향상시키는 시각-언어 트랜스포머 모델을 제안한다. 텍스트를 활용해 가짜 레이블 생성을 유도하고, 지수적 가짜 레이블 반복(EPI) 기법을 도입함으로써 LViT는 라벨 데이터의 25%만으로도 완전 감독 모델과 동등한 최신 기술 성능을 달성한다.
Deep learning has been widely used in medical image segmentation and other aspects. However, the performance of existing medical image segmentation models has been limited by the challenge of obtaining sufficient high-quality labeled data due to the prohibitive data annotation cost. To alleviate this limitation, we propose a new text-augmented medical image segmentation model LViT (Language meets Vision Transformer). In our LViT model, medical text annotation is incorporated to compensate for the quality deficiency in image data. In addition, the text information can guide to generate pseudo labels of improved quality in the semi-supervised learning. We also propose an Exponential Pseudo label Iteration mechanism (EPI) to help the Pixel-Level Attention Module (PLAM) preserve local image features in semi-supervised LViT setting. In our model, LV (Language-Vision) loss is designed to supervise the training of unlabeled images using text information directly. For evaluation, we construct three multimodal medical segmentation datasets (image + text) containing X-rays and CT images. Experimental results show that our proposed LViT has superior segmentation performance in both fully-supervised and semi-supervised setting. The code and datasets are available at https://github.com/HUANGLIZI/LViT.
연구 동기 및 목표
- 분할 작업에서 고급 품질의 라벨된 의료 영상 데이터가 부족한 문제를 해결하기 위해.
- 전문가가 작성한 임상 텍스트를 통합하여 준감독 학습에서 가짜 레이블 품질을 향상시키기 위해.
- 이미지와 텍스트에서 동시에 학습하는 다중모odal 프레임워크를 개발하여 분할 성능을 향상시키기 위해.
- 이미 전자 건강 기록에서 확보된 임상 텍스트 애너테이션을 추가적인 애너테이션 비용 없이 효과적으로 활용하기 위해.
- 텍스트 제공된 병변 위치 정보와 일치하는 어텐션 메커니즘을 통해 모델의 해석 가능성 향상시키기 위해.
제안 방법
- LViT는 국소 이미지 특징을 유지하면서도 전반적인 맥락을 포착하기 위해 픽셀 수준의 어텐션 모듈(PLAM)을 갖춘 하이브리드 CNN-Transformer 아키텍처를 사용한다.
- 모델 파라미터를 줄이기 위해 전체 텍스트 인코더 대신 학습 가능한 임베딩 레이어를 통해 텍스트 특징를 임베딩한다.
- 지수적 가짜 레이블 반복(EPI) 기법은 라벨된 데이터와 라벨이 없는 데이터를 모두 활용하여 가짜 레이블을 점진적으로 개선한다.
- 새로운 LV(Language-Vision) 손실은 텍스트 임베딩을 직접 사용해 라벨이 없는 이미지 학습을 직접 지도함으로써 엔드 투 엔드 텍스트 유도 학습을 가능하게 한다.
- 텍스트 입력은 구조화된 임상 기술 기술(예: 종양 위치)로 제공되며, 토큰화되어 비전 트랜스포머 인코더에 통합된다.
- 모델는 X-ray 및 CT 영상와 방사선의사 애너테이션 텍스트 기술이 결합된 세 개의 다중모달 데이터셋에서 훈련된다.
실험 결과
연구 질문
- RQ1의료 텍스트 애너테이션은 저자원 환경에서 분할 성능 향상에 기여할 수 있는가?
- RQ2텍스트 유도 가짜 레이블 정밀화는 의료 영상 분할에서 준감독 학습을 향상시킬 수 있는가?
- RQ3임상 텍스트를 통합하면 병변 영역에서 어텐션 정렬이 향상되는가?
- RQ4라벨 데이터의 25%만으로도 비전-언어 모델이 완전 감독 모델과 동등한 성능을 달성할 수 있는가?
- RQ5텍스트 입력은 병변 탐지에서 어텐션 맵과 모델의 해석 가능성에 어떤 영향을 미치는가?
주요 결과
- LViT는 MosMedData+에서 74.57%의 Dice 스코어와 61.33%의 mIoU를 기록하여 UNet, UNet++, nnUNet, TransUNet를 모두 초월했다.
- QaTa-COV19 데이터셋에서 LViT는 83.66%의 Dice 스코어와 75.11%의 mIoU를 기록하여 코로나19 폐 영역 분할에서 뛰어난 성능을 보였다.
- ESO-CT 데이터셋에서 LViT는 71.53%의 Dice 스코어와 59.94%의 mIoU를 기록하여 다양한 해부학적 영역에서의 강건성을 입증했다.
- 학습 라벨의 1/4만으로도 LViT-T는 완전 감독 모델과 동등한 성능을 보였으며, 저자원 환경에서의 효과성을 확인했다.
- GradCAM 시각화 결과, 텍스트가 제공될 경우 LViT-TW와 LViT-T 모델이 병변 영역에 더 정확하게 집중하며 비대상 영역에서의 오작동을 줄였다.
- 텍스트 정보 도입으로 어텐션 구조가 크게 변화했으며, 이미지 전용 특징가 실패한 경우에도 DownViT1 레이어가 병변 영역을 활성화했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.