Skip to main content
QUICK REVIEW

[논문 리뷰] Advancing Radiograph Representation Learning with Masked Record Modeling

Hong-Yu Zhou, Chenyu Lian|arXiv (Cornell University)|2023. 01. 30.
COVID-19 diagnosis using AI인용 수 18
한 줄 요약

MRM은 방사선 사진 패치와 관련 보고 토큰을 공동으로 마스킹하고 재구성하는 통합 사전 학습 프레임워크를 도입하여 흉부 X선 작업 전반에 걸친 라벨 효율적 전이 성능을 강하게 제공합니다.

ABSTRACT

Modern studies in radiograph representation learning rely on either self-supervision to encode invariant semantics or associated radiology reports to incorporate medical expertise, while the complementarity between them is barely noticed. To explore this, we formulate the self- and report-completion as two complementary objectives and present a unified framework based on masked record modeling (MRM). In practice, MRM reconstructs masked image patches and masked report tokens following a multi-task scheme to learn knowledge-enhanced semantic representations. With MRM pre-training, we obtain pre-trained models that can be well transferred to various radiography tasks. Specifically, we find that MRM offers superior performance in label-efficient fine-tuning. For instance, MRM achieves 88.5% mean AUC on CheXpert using 1% labeled data, outperforming previous R$^2$L methods with 100% labels. On NIH ChestX-ray, MRM outperforms the best performing counterpart by about 3% under small labeling ratios. Besides, MRM surpasses self- and report-supervised pre-training in identifying the pneumonia type and the pneumothorax area, sometimes by large margins.

연구 동기 및 목표

  • 자기지도 학습과 보고 기반 radiograph 학습을 결합하여 보완 신호를 활용하려는 동기부여.
  • 마스킹된 방사선 사진과 마스킹된 영상 보고서를 함께 완성하는 통합 사전 학습 프레임워크를 제안합니다.
  • 낮은 라벨링 구간에서 일반화하는 전이 가능한 방사선 사진 표현을 학습합니다.
  • MRM 사전 학습을 통해 다수의 공개 흉부 X선 데이터셋에서 성능 향상을 시연합니다.

제안 방법

  • 저해상도 방사선 사진과 관련 보고서에 대해 무작위 마스킹 및 높은 마스킹 비율을 적용합니다.
  • 방사선 사진 인코더를 사용하여 고해상도 패치 복원과 보고서 토큰 복원을 모두 지원하는 패치 임베딩을 생성합니다.
  • 전체 방사선 사진 표현을 비마스크 처리된 보고서 토큰 임베딩에 더해 보고서 복원을 위한 하이브리드 표현(마스킹된 언어 모델링)을 형성합니다.
  • 저해상도 입력으로부터 고해상도 방사선 사진 패치를 패치 기반 이미지 디코더를 통해 복원합니다(MIM 손실).
  • 보고서의 마스킹된 언어 모델링 손실과 이미지 복원의 MSE 손실을 결합한 다중 작업 objective로 학습합니다(L = L_R + lambda L_I).
  • 사전 학습된 이미지 인코더를 NIH ChestX-ray, CheXpert, RSNA Pneumonia, SIIM, COVID-19 데이터셋 전반의 다운스트림 분류 및 분할 작업에 대해 미세 조정하여 전이를 시연합니다.

실험 결과

연구 질문

  • RQ1자기지도 학습(이미지 전용)과 보고서 기반 학습(텍스트 기반) 방사선 사진 표현을 효과적으로 하나로 통합할 수 있는가?
  • RQ2마스킹된 이미지 재구성 및 마스킹된 보고서 복원을 함께 학습하면 라벨이 제한된 상황에서 전이가 향상되는가?
  • RQ3다양한 흉부 X선 벤치마크에서 라벨링 비율이 달라질 때 MRM의 성능은 어떻게 변하는가?
  • RQ4다중 작업 마스킹과 초해상도 복원이 다운스트림 성능에 어떤 기여를 하는가?

주요 결과

  • MRM은 1% 라벨 데이터에서 CheXpert에서 평균 AUC 88.5%를 달성하여 100% 라벨으로 학습한 기존 방법을 능가합니다.
  • NIH ChestX-ray에서 MRM은 적은 라벨링 비율에서 최적의 상대방보다 약 3% 더 높은 성능을 보입니다.
  • MRM은 여러 작업에서 pneumonia 유형 및 기흉 영역 식별에 있어 자기 지도 및 보고서 기반 사전 학습을 능가합니다.
  • 제한된 감독 하에서 CheXpert, RSNA Pneumonia, SIIM에서 CONVIRT, GLoRIA, REFERS 및 다른 베이스라인을 지속적으로 능가합니다.
  • 절삭 분해 실험은 마스킹된 보고 모델링과 마스킹된 방사선 사진 모델링이 모두 이득에 기여하며, 초해상도 복원이 다양한 라벨 구간에서 추가 이점을 제공합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.