Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised vision-language pretraining for Medical visual question answering

Pengfei Li, Gang Liu|arXiv (Cornell University)|2022. 11. 24.
Multimodal Machine Learning Applications인용 수 10
한 줄 요약

이 논문은 의료 시각질문응답(VQA)를 위한 자기지도 학습 시각-언어 미리학습 방법 M2I2를 제안하며, 의료 영상 설명문 데이터 기반으로 손실된 이미지 모델링, 손실된 언어 모델링, 이미지-텍스트 매칭 및 대비 정렬을 통합 최적화합니다. 이 방법은 세 가지 공개 의료 VQA 벤치마크에서 최신 기준 성능을 달성하여, 제한된 애너테이션 데이터에서도 일반화 능력이 향상됨을 입증합니다.

ABSTRACT

Medical image visual question answering (VQA) is a task to answer clinical questions, given a radiographic image, which is a challenging problem that requires a model to integrate both vision and language information. To solve medical VQA problems with a limited number of training data, pretrain-finetune paradigm is widely used to improve the model generalization. In this paper, we propose a self-supervised method that applies Masked image modeling, Masked language modeling, Image text matching and Image text alignment via contrastive learning (M2I2) for pretraining on medical image caption dataset, and finetunes to downstream medical VQA tasks. The proposed method achieves state-of-the-art performance on all the three public medical VQA datasets. Our codes and models are available at https://github.com/pengfeiliHEU/M2I2.

연구 동기 및 목표

  • 의료 시각질문응답(VQA)에서 애너테이션 데이터가 제한된 문제를 해결하기 위해 모델의 일반화 능력을 향상시키는 것.
  • 의료 영상에서 시각과 언어 표현을 효과적으로 정렬하는 자기지도 미리학습 프레임워크를 개발하는 것.
  • 의료 영상 설명문 데이터 기반으로 다수의 미리학습 목표를 통합 최적화하여 최종 의료 VQA 성능을 향상시키는 것.
  • 사람이 애너테이션한 VQA 쌍에 대한 최소한의 의존도를 가진 전처리-피지테이닝 파라다임을 통해 의료 VQA에 대한 강력한 베이스라인을 수립하는 것.

제안 방법

  • 이 방법은 미리학습 기간 동안 손상된 패치를 복원함으로써 의료 영상에서 손실된 이미지 모델링(MIM)을 적용합니다.
  • 임상 질문 및 답변 설명문의 마스킹된 토큰을 복원하기 위해 손실된 언어 모델링(MLM)을 적용합니다.
  • 이미지-텍스트 매칭(ITM)은 주어진 이미지와 텍스트 쌍이 양성인지 부정인지 예측하는 데 사용됩니다.
  • 대비 학습(CL)은 양성 쌍 간의 일치를 최대화하고 부정 쌍 간의 일치를 최소화함으로써 이미지 및 텍스트 임베딩을 정렬하는 데 적용됩니다.
  • 네 가지 목표인 MIM, MLM, ITM 및 CL은 의료 영상 설명문 데이터 기반의 통합 M2I2 프레임워크에서 함께 최적화됩니다.
  • 미리학습된 모델은 최소한의 적응으로 최종 의료 VQA 데이터셋에서 피지테이닝됩니다.

실험 결과

연구 질문

  • RQ1제한된 레이블 데이터에서 손실된 모델링 및 대비 학습을 포함한 다수의 자기지도 미리학습 목표를 통합함으로써 의료 VQA 성능 향상이 가능한가요?
  • RQ2시각-언어 목표(즉, MIM, MLM, ITM, CL)의 통합 최적화가 의료 VQA에 대한 일반화 가능한 표현을 학습하는 데 얼마나 효과적인가요?
  • RQ3제안된 M2I2 프레임워크는 표준 의료 VQA 벤치마크에서 기존의 시각-언어 미리학습 방법을 초월하는가요?
  • RQ4의료 영상 설명문에서의 미리학습은 최종 VQA 작업으로의 일반화 정도가 어느 정도인가요?

주요 결과

  • M2I2 방법은 연구에서 평가된 세 가지 공개 의료 VQA 벤치마크에서 모두 최신 기준 성능을 달성합니다.
  • 효과적인 자기지도 미리학습 덕분에, 특히 데이터가 적은 환경에서 기존 방법보다 뚜렷한 성능 향상을 보입니다.
  • 제거 실험 결과, 모든 네 가지 미리학습 목표(MIM, MLM, ITM, CL)가 최종 VQA 성능에 긍정적인 기여를 한다고 확인됩니다.
  • 모델은 다양한 임상 질문 유형으로도 잘 일반화되어 있어, 강력한 시각-언어 이해 능력을 보입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.