[논문 리뷰] Towards Concept-based Interpretability of Skin Lesion Diagnosis using Vision-Language Models
이 논문은 전문가가 주석 처리한 피부 병변 개념을 텍스트 임베딩으로 활용하여 시각-언어 모델을 사용한 피부 병변 진단을 위한 개념 기반 해석 가능성 프레임워크를 제안한다. 간단한 임베딩 학습 전략을 통해 CLIP를 미세조정함으로써, 개념 주석 데이터가 훨씬 적게 필요함에도 불구하고 최신 기술 수준의 성능을 달성하였으며, 기준 CLIP 및 LLM이 생성한 기술 설명을 사용하는 모델들보다 뛰어난 성능을 보였다.
Concept-based models naturally lend themselves to the development of inherently interpretable skin lesion diagnosis, as medical experts make decisions based on a set of visual patterns of the lesion. Nevertheless, the development of these models depends on the existence of concept-annotated datasets, whose availability is scarce due to the specialized knowledge and expertise required in the annotation process. In this work, we show that vision-language models can be used to alleviate the dependence on a large number of concept-annotated samples. In particular, we propose an embedding learning strategy to adapt CLIP to the downstream task of skin lesion classification using concept-based descriptions as textual embeddings. Our experiments reveal that vision-language models not only attain better accuracy when using concepts as textual embeddings, but also require a smaller number of concept-annotated samples to attain comparable performance to approaches specifically devised for automatic concept generation.
연구 동기 및 목표
- 임상적 의사결정 과정과 일치하는 개념 기반의 해석 가능한 피부 병변 진단 시스템을 개발하기 위해.
- 시각-언어 모델의 제로샷 능력을 활용하여 고비용의 전문가 주석 처리 개념 데이터셋에 대한 의존도를 줄이기 위해.
- 전문가가 선택한 피부 병변 특징 개념을 텍스트 임베딩으로 사용하여 분류 정확도와 해석 가능성을 향상시키기 위해.
- CLIP에 간단한 임베딩 학습 절차를 적용할 경우, 자동 개념 생성을 위해 특별히 설계된 모델들과 비교해도 성능이 유사하거나 이를 초월할 수 있음을 입증하기 위해.
제안 방법
- 공통의 다중 모odal 임베딩 공간을 학습하기 위해 이미지와 텍스트의 조합 투영 헤드를 사용해 CLIP를 미세조정한다.
- 이미지 특징과 질병 레이블 또는 피부 병변 특징의 텍스트 임베딩 간의 코사인 유사도를 사용해 분류한다.
- 개념 기반 유사도 점수 위에 선형 분류기를 적용하여, 설명 가능성을 위한 개념 블로킹 모델(CBM)으로 기능한다.
- 이미지 세그멘테이션을 활용해 병변 영역에 집중함으로써 모델의 강건성과 성능을 향상시킨다.
- 일치하는 이미지-레이블 쌍 간의 유사도를 최대화하고, 일치하지 않는 쌍 간의 유사도를 최소화하기 위해 대비 목적을 사용해 투영 헤드를 훈련시킨다.
- 사전 학습된 CLIP 이미지 및 텍스트 인코더를 동결된 백본으로 사용하고, 투영 레이어만 미세조정한다.
실험 결과
연구 질문
- RQ1전문가가 주석 처리한 피부 병변 특징를 텍스트 프롬프트로 사용할 때, CLIP와 같은 시각-언어 모델이 피부 병변 진단에 효과적으로 적용될 수 있는가?
- RQ2전문가가 선택한 피부 병변 특징를 텍스트 임베딩으로 사용할 경우, LLM이 생성한 기술 설명보다 더 높은 성능을 낼 수 있는가?
- RQ3CLIP에 간단한 임베딩 학습 절차를 적용할 경우, 자동 개념 생성을 위해 특별히 설계된 모델들과 유사하거나 이를 초월하는 성능을 달성할 수 있는가?
- RQ4개념 주석 처리된 샘플 수가 모델 성능에 미치는 영향은 무엇이며, 더 적은 주석 데이터로도 일반화가 가능한가?
주요 결과
- 제안된 방법은 원본 CLIP 대비 Derm7pt에서 평균 11.5% 향상된 밸런스된 정확도를 기록했으며, ISIC 2018에선 9.2% 향상되었다.
- 전문가가 주석 처리한 피부 병변 특징를 텍스트 임베딩으로 사용할 경우, LLM이 생성한 기술 설명을 사용하는 기준 전략 대비 더 높은 성능을 보였으며, Derm7pt에선 2.3% 향상되고 ISIC 2018에선 7.5% 향상되었다.
- MONET와 유사한 성능을 달성하면서도 약 80배 적은 학습 시간이 소요되었다.
- 단지 40~60개의 이미지-레이블 쌍만으로도, 제안된 방법에 의해 미세조정된 CLIP 버전이 ISIC 2018에서 MONET의 성능을 따라잡았다.
- 임상 지식과 일치하는 개념 기반 설명을 제공하여, 해석 가능성을 향상시켰다. 예를 들어 ABCDE 기준과 같은 임상 지침과 일치한다.
- 모든 데이터셋과 CLIP 버전에서 기준 모델 대비 CBM 전략이 일관되게 향상되었으며, ISIC 2018에선 최대 +7.5% 향상된 성과를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.