Skip to main content
QUICK REVIEW

[논문 리뷰] PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology

Yuxuan Sun, Hao Wu|arXiv (Cornell University)|2024. 01. 29.
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

PathMMU는 GPT-4V를 사용하여 구축하고 7명의 병리학자 전문가가 검증한 대규모 다중모달 기준으로, 병리학 Q&A 쌍 33,428개와 이미지 24,067장으로 구성되어 있다. 이 기준은 GPT-4V와 같은 최고 수준의 LMMs도 제로샷 정확도가 49.8%에 불과하여 인간 전문가의 71.8%에 못 미치지만, 미세조정된 오픈소스 모델이 GPT-4V를 초월함을 보여주며 PathMMU가 병리학 전용 LMM 개발을 선도하는 데 기여하고 있음을 시사한다.

ABSTRACT

The emergence of large multimodal models has unlocked remarkable potential in AI, particularly in pathology. However, the lack of specialized, high-quality benchmark impeded their development and precise evaluation. To address this, we introduce PathMMU, the largest and highest-quality expert-validated pathology benchmark for Large Multimodal Models (LMMs). It comprises 33,428 multimodal multi-choice questions and 24,067 images from various sources, each accompanied by an explanation for the correct answer. The construction of PathMMU harnesses GPT-4V's advanced capabilities, utilizing over 30,000 image-caption pairs to enrich captions and generate corresponding Q&As in a cascading process. Significantly, to maximize PathMMU's authority, we invite seven pathologists to scrutinize each question under strict standards in PathMMU's validation and test sets, while simultaneously setting an expert-level performance benchmark for PathMMU. We conduct extensive evaluations, including zero-shot assessments of 14 open-sourced and 4 closed-sourced LMMs and their robustness to image corruption. We also fine-tune representative LMMs to assess their adaptability to PathMMU. The empirical findings indicate that advanced LMMs struggle with the challenging PathMMU benchmark, with the top-performing LMM, GPT-4V, achieving only a 49.8% zero-shot performance, significantly lower than the 71.8% demonstrated by human pathologists. After fine-tuning, significantly smaller open-sourced LMMs can outperform GPT-4V but still fall short of the expertise shown by pathologists. We hope that the PathMMU will offer valuable insights and foster the development of more specialized, next-generation LMMs for pathology.

연구 동기 및 목표

  • 병리학 분야에서 대규모 다중모달 모델(LMMs)을 평가하기 위한 고품질, 전문가 검증 기준의 부족을 해결하기 위해.
  • 실제 임상 진단 과제를 반영한 종합적이고 다양한, 해석 가능한 다중모달 데이터셋을 구축하기 위해.
  • LMM과 임상 전문성 간 격차를 정량화하기 위해 인간 전문가 성능 기준을 설정하기 위해.
  • 병리학 전용 전문가가 정제한 기준에서 오픈소스 및 비오픈소스 LMM의 강건성과 적응 능력을 평가하기 위해.
  • 시각적 忽略 및 단서 학습과 같은 핵심 한계를 특정하여 향후 전문화된 LMM 개발을 이끄는 데 기여하기 위해.

제안 방법

  • GPT-4V를 활용해 30,000개 이상의 이미지-캡션 쌍을 생성하고, 계층적 프롬프팅 전략을 통해 이를 다중모달 Q&A 쌍으로 연결하였다.
  • 다양한 자료원(예: PubMed, 병리학 앨범, 소셜 미디어, 교육용 영상, 분류 데이터셋)에서 데이터를 확보하여 기관 시스템과 질환 유형의 광범위한 커버리지 확보를 위해 노력하였다.
  • 엄격한 이중 단계 캐리게이션 프로세스를 적용: 초기 AI 생성 후, 테스트 및 검증 세트에 대해 7명의 자격을 갖춘 병리학 전문가가 검증하였다.
  • 병리학 전문가들이 동일한 질문에 답변함으로써 인간 전문가 성능 기준을 설정하여 LMM 성능와 직접 비교 가능하게 하였다.
  • 14개의 오픈소스 및 4개의 비오픈소스 LMM에 대해 제로샷 평가와 미세조정 실험을 수행하였으며, 두 가지 미세조정 전략(직접 답변 생성 및 답변-설명 생성)을 사용하였다.
  • 이미지 손상에 대한 모델의 강건성 평가 및 다양한 데이터 서브셋(예: PubMed, SocialPath, Atlas)에서의 성능 분석을 통해 도메인 일반화 능력을 평가하였다.

실험 결과

연구 질문

  • RQ1최신 기술의 LMM은 인간 병리학자와 비교해 종합적이고 전문가가 검증한 병리학 기준에서 어떻게 성능을 내는가?
  • RQ2PathMMU에서의 미세조정이 LMM 성능을 크게 향상시킬 수 있는가? 답변-설명 생성을 위한 미세조정을 통해 생성한 모델가 직접 답변 생성 모델보다 성능이 뛰어나게 되는가?
  • RQ3병리학 이미지를 분석할 때 LMM은 텍스트적 단서에 얼마나 의존하는가? 이는 정확도에 어떤 영향을 미치는가?
  • RQ4현재 LMM의 주요 실패 유형(예: 시각적 忽略 또는 단서 학습)은 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ5LMM은 이미지 손상에 얼마나 강건한가? PathMMU 내 다양한 데이터 소스 간 성능에 차이가 나는가?

주요 결과

  • 최고 성능을 보인 GPT-4V도 PathMMU에서 제로샷 정확도가 49.8%에 그쳐 인간 병리학자의 71.8%에 크게 못 미친다.
  • 미세조정 후, InstructBLIP-FLAN-T5-XL 및 InstructBLIP-FLAN-T5-XXL 등 더 작은 오픈소스 LMM이 GPT-4V를 초월하여 최대 61.4%의 정확도를 기록했으며, 답변-설명 생성을 위한 미세조정 방식을 사용하였다.
  • 직접 답변 생성을 위한 미세조정이 답변-설명 생성을 위한 미세조정보다 성능이 뛰어났으며, 후자는 각각 0.3%와 2.3%의 약간의 성능 하락을 보였다.
  • 성능 향상의 가장 큰 기여 요소는 미세조정이었으며, InstructBLIP-FLAN-T5-XL는 직접 답변 생성을 위한 미세조정으로 21.5%포인트의 정확도 향상을 기록하였다.
  • 모델들은 이미지 손상에 대해 빈약한 강건성을 보였고, 뚜렷한 시각적 특징을 종종 忽略하는 경향을 보여, 텍스트적 단서에 대한 의존도가 높고 시각적 이해 능력이 열악함을 시사한다.
  • 서브셋 간 성능에 차이가 있었으며, 특히 PubMed 및 교육 콘텐츠 서브셋에서 성능이 가장 열악하여 도메인 특화 일반화 문제를 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.