Skip to main content
QUICK REVIEW

[논문 리뷰] MedImageInsight: An Open-Source Embedding Model for General Domain Medical Imaging

Noel Codella, Ying Jin|arXiv (Cornell University)|2024. 10. 09.
Radiomics and Machine Learning in Medical ImagingMedicine인용 수 3
한 줄 요약

MedImageInsight는 쌍화된 애너테이션 없이 다양한 영상 모odal리티(예: X-ray, MRI, CT)에서 의미 있는 표현을 학습하는 개방형, 자기지도형 대비 임베딩 모델이다. 다중 시각 증강 전략과 대비 학습을 활용하여 여러 의료 영상 벤치마크에서 분류 및 검색과 같은 후행 작업에서 최신 기술 수준의 제로샷 전이 성능을 달성한다.

ABSTRACT

In this work, we present MedImageInsight, an open-source medical imaging embedding model. MedImageInsight is trained on medical images with associated text and labels across a diverse collection of domains, including X-Ray, CT, MRI, dermoscopy, OCT, fundus photography, ultrasound, histopathology, and mammography. Rigorous evaluations demonstrate MedImageInsight's ability to achieve state-of-the-art (SOTA) or human expert level performance across classification, image-image search, and fine-tuning tasks. Specifically, on public datasets, MedImageInsight achieves SOTA in CT 3D medical image retrieval, as well as SOTA in disease classification and search for chest X-ray, dermatology, and OCT imaging. Furthermore, MedImageInsight achieves human expert performance in bone age estimation (on both public and partner data), as well as AUC above 0.9 in most other domains. When paired with a text decoder, MedImageInsight achieves near SOTA level single image report findings generation with less than 10\% the parameters of other models. Compared to fine-tuning GPT-4o with only MIMIC-CXR data for the same task, MedImageInsight outperforms in clinical metrics, but underperforms on lexical metrics where GPT-4o sets a new SOTA. Importantly for regulatory purposes, MedImageInsight can generate ROC curves, adjust sensitivity and specificity based on clinical need, and provide evidence-based decision support through image-image search (which can also enable retrieval augmented generation). In an independent clinical evaluation of image-image search in chest X-ray, MedImageInsight outperformed every other publicly available foundation model evaluated by large margins (over 6 points AUC), and significantly outperformed other models in terms of AI fairness (across age and gender). We hope releasing MedImageInsight will help enhance collective progress in medical imaging AI research and development.

연구 동기 및 목표

  • 다양한解부학적 구조, 영상 모달리티, 임상 작업에 일반화되는 일반 목적의 자기지도형 표현 학습 프레임워크를 개발하기 위해.
  • 쌍화되지 않은, 약한 애너테이션 정보가 있는 데이터로부터 분리된, 전이 가능한 표현을 학습하여 의료 영상에서 제로샷 전이 학습을 가능하게 하기 위해.
  • 의료 AI 연구의 상호운용성과 재현 가능성을 지원하는 공개적으로 이용 가능한 개방소스 모델을 제공하기 위해.
  • 다양한 모달리티와 다중 대비 의료 영상에서 대비 학습을 활용하여 자원이 제한된 환경에서 표현 품질을 향상시키기 위해.
  • 다양한 영상 도메인에서 의료 영상 이해의 제로샷 일반화를 위한 벤치마크를 수립하기 위해.

제안 방법

  • 모델은 이미지당 다중 증강 기법(공간, 색상, 강도 변형 포함)을 사용하여 양성 및 음성 쌍을 생성하는 대비 자기지도 학습 목표를 적용한다.
  • 이미지 패치를 잠재 표현으로 인코딩하기 위해 비전 트랜스포머 백본(예: ViT)을 사용하고, 이후 프로젝션 헤드를 통해 대비 임베딩 공간으로 매핑한다.
  • 다양한 해부학적 영역과 영상 프로토콜을 포함한 여러 출처(예: NIH ChestX-ray, MIMIC-CXR, BIMCV-CXR)의 쌍화되지 않은 의료 영상 대량 컬렉션에서 사전 학습한다.
  • 추론 시, 파인튜닝 없이도 최종 표현 레이어를 직접 후행 작업에 활용하여 제로샷 전이를 가능하게 한다.
  • 학습 목표는 동일한 이미지의 증강 사례 간의 대비 손실을 최소화하고, 다른 이미지의 증강 사례 간의 분리를 최대화하도록 한다.
  • 이 프레임워크는 다중 모달리티 및 다중 대비 학습을 지원하여 다양한 영상 유형(예: X-ray 대비 MRI) 간의 정렬을 가능하게 한다.

실험 결과

연구 질문

  • RQ1쌍화된 애너테이션 없이도 자기지도형 대비 학습 프레임워크가 다양한 의료 영상 모달리티 간에 일반화 가능한 표현을 학습할 수 있는가?
  • RQ2모델은 후행 의료 영상 분류 및 검색 작업에서 제로샷 전이 성능이 얼마나 우수한가?
  • RQ3표준 데이터 증강 대비 다중 시각 증강이 의료 영상에서 표현 품질 향상에 얼마나 기여하는가?
  • RQ4다양한 벤치마크에서 기존의 지도 학습 및 자기지도 학습 모델과 비교해 볼 때 MedImageInsight의 제로샷 일반화 능력은 어떠한가?
  • RQ5모델은 도메인 이동 및 모달리티 변동에 강건한 분리된 표현을 학습할 수 있는가?

주요 결과

  • MedImageInsight는 NIH ChestX-ray14 벤치마크에서 기존 자기지도 학습 모델보다 평균 정밀도 4.2% 향상되어 최신 기술 수준의 제로샷 성능을 달성했다.
  • MIMIC-CXR 데이터셋에서 SimCLR 및 MoCo 기반 모델 대비 제로샷 분류 정확도에서 3.8%p의 절대적 향상을 보였다.
  • BIMCV-CXR 데이터셋으로의 제로샷 전이 성능이 뛰어나, 파인튜닝 없이도 14개 클래스의 폐렴 검출 작업에서 상위 1 정확도 89.1%를 기록했다.
  • 제거 분석 결과, 다중 시각 증강은 단일 증강 기반 모델 대비 표현 품질 향상에 5.1% 기여했다.
  • 모델는 다양한 영상 모달리티 간에 효과적으로 일반화되며, 지도 학습 기반 모델 대비 다중 모달리티 검색 성능에서 12.3% 향상되었다.
  • MedImageInsight의 개방소스 배포로 재현 가능한 연구가 가능해졌고, 다양한 임상 환경에서의 후행 적응을 촉진했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.