Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer-based interpretable multi-modal data fusion for skin lesion classification

Theodor Cheslerean-Boghiu, Melia-Evelina Fleischmann|arXiv (Cornell University)|2023. 04. 03.
Cutaneous Melanoma Detection and Management인용 수 4
한 줄 요약

이 논문은 자기주의 주의 메커니즘을 사용하여 피부 병변 분류를 위한 단일 단계 과정에서 피부 내시경 영상과 환자 메타데이터를 통합하는 트랜스포머 기반의 해석 가능한 다중 모odal 융합 모델을 제안한다. 이 방법은 이미지 기반 및 메타데이터 기반 환경에서 모두 최신 기술 수준의 성능을 달성하면서도, 시각적 중요도 및 관련성 맵을 통해 본질적인 해석 가능성을 제공하여 임상의가 모델의 결정을 검증하고 인공지능 기반 진단에 신뢰를 쌓을 수 있도록 한다.

ABSTRACT

A lot of deep learning (DL) research these days is mainly focused on improving quantitative metrics regardless of other factors. In human-centered applications, like skin lesion classification in dermatology, DL-driven clinical decision support systems are still in their infancy due to the limited transparency of their decision-making process. Moreover, the lack of procedures that can explain the behavior of trained DL algorithms leads to almost no trust from clinical physicians. To diagnose skin lesions, dermatologists rely on visual assessment of the disease and the data gathered from the patient's anamnesis. Data-driven algorithms dealing with multi-modal data are limited by the separation of feature-level and decision-level fusion procedures required by convolutional architectures. To address this issue, we enable single-stage multi-modal data fusion via the attention mechanism of transformer-based architectures to aid in diagnosing skin diseases. Our method beats other state-of-the-art single- and multi-modal DL architectures in image-rich and patient-data-rich environments. Additionally, the choice of the architecture enables native interpretability support for the classification task both in the image and metadata domain with no additional modifications necessary.

연구 동기 및 목표

  • 딥 러닝 기반 피부과 의사결정 지원 시스템의 투명성 부족과 임상적 신뢰 부족 문제를 해결하기 위해.
  • 기존의 컨volutional 네트워크 기반 융합 방법이 특징 수준과 결정 수준 융합을 분리하는 데서 비롯하는 한계를 극복하기 위해.
  • 성능 향상을 위해 트랜스포머의 어텐션 메커니즘을 활용한 단일 단계, 엔드 투 엔드 다중 모달 데이터 융합을 가능하게 하기 위해.
  • 추가 수정 없이도 이미지 및 메타데이터 모달 모두에 대해 본질적인 해석 가능성을 제공하기 위해.
  • 모델의 해석이 알려진 피부과 진단 기준과 환자 병력 요소와 일치하도록 임상적 관련성을 확보하기 위해.

제안 방법

  • 공유된 잠재 공간에서 피부 내시경 영상과 표본형 환자 메타데이터를 동시에 인코딩하기 위해 트랜스포머 기반 아키텍처를 활용한다.
  • 분류 과정에서 영상 패치와 메타데이터 특징의 중요도를 동적으로 가중하기 위해 멀티헤드 자기주의 주의를 사용한다.
  • 모odal별 토크나이저와 학습 가능한 위치 임베딩을 통해 영상 및 표본형 데이터의 공동 임베딩을 수행한다.
  • 융합된 표현에서 피부 병변 진단을 예측하기 위해 [CLS] 토큰에 분류 헤드를 적용한다.
  • 영상 주의의 시각적 해석 가능성을 확보하기 위해 Grad-CAM 및 기울기 기반 시각적 중요도 맵을 활용한다.
  • LIME 방식의 특징 기여도를 계산하여 개별 메타데이터 요소의 관련성 점수를 도출함으로써 임상의가 모델 결정을 해석할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1단일 단계 트랜스포머 기반 아키텍처가 기존 최신 기술 수준의 모델보다 다중 모달 피부 병변 분류에서 뛰어난 성능을 보일 수 있는가?
  • RQ2트랜스포머의 어텐션 메커니즘이 피부 내시경 영상과 임상 메타데이터의 융합에 얼마나 효과적으로 기여하는가?
  • RQ3모델의 어텐션 메커니즘이 악성흑색종에서의 병변 변화 행동이나 기저세포암에서의 해부학적 위치와 같은 임상적으로 관련 있는 특징을 올바르게 강조하는가?
  • RQ4모델의 해석 출력(시각적 중요도 맵 및 관련성 맵)이 임상의가 모델 예측을 검증하거나 수정하는 데 도움이 되는가?
  • RQ5내적 분산이 높은 시각적으로 모호하거나 희귀한 병변(예: ACK, SEK)에 대해 모델은 어떤 성능을 보이는가?

주요 결과

  • 제안된 모델은 이미지 기반 및 환자 데이터 기반 환경 모두에서 기존 단일 및 다중 모달 딥 러닝 아키텍처를 능가하는 최신 기술 수준의 성능을 달성한다.
  • 낮은 대비 또는 모발에 의해 가림을 받는 경우에도 모델이 영상에서 관련 병변 영역을 우수하게 국소화함을 입증하였다.
  • 시각적 중요도 맵은 악성흑색종에서의 변화 행동이나 기저세포암에서의 해부학적 위치와 같은 임상적으로 관련 있는 특징을 정확히 식별함을 보여준다.
  • 관련성 맵은 모델이 메타데이터와 질병 간에 의미 있는 연관성을 학습하고 있음을 보여주며, 예를 들어 흑색종에 대한 연령, 기저세포암에 대한 성별 및 해부학적 위치, 변형암에 대한 병변 성장 행동 등을 올바르게 반영한다.
  • 모델은 마커와 같은 비의료적 단서에 주목함에도 불구하고 이를 기반으로 잘못 분류하지 않아, 임의의 상관관계에 대한 강건성을 보여준다.
  • ACK 및 SEK와 같은 희귀 클래스의 경우 내부 분산이 적어 국소화 정확도가 떨어지지만, SCC와 같은 고분산 클래스에 대해서는 여전히 잘 일반화됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.