Skip to main content
QUICK REVIEW

[논문 리뷰] Text-guided Foundation Model Adaptation for Pathological Image Classification

Yunkun Zhang, Jin Gao|arXiv (Cornell University)|2023. 07. 27.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 사전 훈련된 기초 모델에서 추출한 이미지 및 텍스트 임베딩을 연결함으로써 데이터 효율적인 방법인 CITE를 제안한다. 동결된 언어 모델을 통해 생물의학 텍스트 지식을 주입하고, 시각 인식기의 파라미터를 최소한으로 튜닝함으로써 CITE는 저데이터 환경에서도 최신 기술 수준의 성능을 달성하며, 다양한 백본 모델 간의 강한 일반화 능력과 호환성을 보여준다.

ABSTRACT

The recent surge of foundation models in computer vision and natural language processing opens up perspectives in utilizing multi-modal clinical data to train large models with strong generalizability. Yet pathological image datasets often lack biomedical text annotation and enrichment. Guiding data-efficient image diagnosis from the use of biomedical text knowledge becomes a substantial interest. In this paper, we propose to Connect Image and Text Embeddings (CITE) to enhance pathological image classification. CITE injects text insights gained from language models pre-trained with a broad range of biomedical texts, leading to adapt foundation models towards pathological image understanding. Through extensive experiments on the PatchGastric stomach tumor pathological image dataset, we demonstrate that CITE achieves leading performance compared with various baselines especially when training data is scarce. CITE offers insights into leveraging in-domain text knowledge to reinforce data-efficient pathological image classification. Code is available at https://github.com/Yunkun-Zhang/CITE.

연구 동기 및 목표

  • 데이터 부족 문제를 해결하기 위해 사전 훈련된 생물의학 텍스트 지식을 활용함으로써 병리학적 이미지 분류 성능을 향상시키는 것.
  • 전체 백본을 파인튜닝하지 않고도 기초 모델을 의료 영상에 효율적으로 적응시키는 것.
  • 텍스트 임베딩을 통한 다중모달 정렬을 통해 자연 이미지와 병리학적 이미지 간의 도메인 갭을 해소하는 것.
  • 다양한 사전 훈련된 시각 및 언어 인코더와 호환되는 모델에 종속되지 않는 프레임워크를 개발하는 것.
  • 소수의 예제 설정에서 도메인 내 생물의학 텍스트가 기존의 분류 헤드를 대체할 수 있음을 입증하는 것.

제안 방법

  • CITE는 시각 인코더에서 추출한 시각적 특징을 투영하고, 동결된 생물의학적 언어 모델에서 유래한 텍스트 임베딩과 정렬함으로써 이미지와 텍스트 임베딩을 연결한다.
  • 사전 훈련된 백본을 동결한 채로 시각 인코더를 적응시키기 위해 학습 가능한 시각 프롬프트와 투영 헤드를 도입한다.
  • 정지 기울기(Stop-gradient)를 적용하여 지식의 무결성을 유지하면서, BioBERT 및 BioLinkBERT와 같은 사전 훈련된 생물의학 언어 모델에서 텍스트 임베딩을 유도한다.
  • 이미지와 텍스트 임베딩 간의 코사인 유사도를 통해 분류를 수행하며, 이는 시각적 프롬프트와 투영 헤드만의 엔드 투 엔드 훈련을 가능하게 한다.
  • 여러 시각 인코더(예: CLIP, ImageNet-21k, INTERN)와 언어 인코더와의 호환성을 확보하여 영향력 있는 통합을 가능하게 한다.
  • 통합 사전 훈련을 피하기 위해 사전 훈련된 단모달 인코더를 활용하고, 적응 단계에서 도메인 특화된 텍스트 지식을 주입한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 생물의학 텍스트 지식이 데이터 부족 환경에서 기초 모델의 병리학적 이미지 분류 성능을 향상시킬 수 있는가?
  • RQ2소수의 예제 설정에서 텍스트 유도 적응은 전통적인 파인튜닝 및 프롬프트 튜닝보다 어떻게 비교되는가?
  • RQ3통합 사전 훈련 없이도 동결된 생물의학 언어 모델이 시각적 표현 학습을 얼마나 향상시킬 수 있는가?
  • RQ4시각적 프롬프트 학습과 도메인 내 텍스트 지식의 조합이 저데이터 환경에서 상호보완적인 성능 향상을 이끌 수 있는가?
  • RQ5CITE 프레임워크는 다양한 시각 및 언어 백본 아키텍처 간에 얼마나 일반화 가능한가?

주요 결과

  • CITE는 16장의 슬라이드(클래스당)만으로 PatchGastric 데이터셋에서 68.7%의 Top-1 정확도를 달성하여, 선형 프로빙(65.4%)과 파인튜닝(66.3%) 기반 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 클래스당 1장의 슬라이드만으로도 CITE는 CLIP 텍스트 인코더를 사용해 60.1%의 정확도를 기록했으며, 선형 프로빙(47.7%)과 파인튜닝(39.1%)보다 높았다.
  • BioLinkBERT를 텍스트 인코더로 사용했을 때, CITE는 모든 학습 데이터를 사용해 69.7%의 정확도를 달성했으며, 다음으로 우수한 방법보다 3.4%포인트 높았다.
  • CITE는 모든 데이터 스케일(클래스당 1~16개 샘플)과 테스트된 모든 시각 및 언어 인코더 조합에서 모든 기반 모델보다 뛰어난 성능을 보였다.
  • 제거 실험 결과, 시각적 프롬프트 학습과 생물의학 텍스트 지식 모두가 필수적임을 확인했으며, 특히 극도로 낮은 데이터 설정에서 텍스트 지식이 가장 큰 기여를 했다.
  • 프레임워크는 강력한 호환성을 보였으며, 다양한 시각 인코더(CLIP, ImageNet-21k, INTERN)와 언어 모델(CLIP, BioBERT, BioLinkBERT)에서 최신 기술 수준의 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.