Skip to main content
QUICK REVIEW

[논문 리뷰] Making the Most of Text Semantics to Improve Biomedical Vision--Language Processing

Benedikt Boecking, Naoto Usuyama|arXiv (Cornell University)|2022. 04. 21.
Topic Modeling인용 수 13
한 줄 요약

이 논문은 도메인 특화 언어 모델(CXR-BERT)과 새로운 논의 인식(pretraining) 목적함수를 활용하여 생물의학 영상-언어 이해 성능을 크게 향상시키는 자기지도 학습 시각-언어 사전학습 프레임워크인 BioViL을 제안한다. 공동 학습 중 마스크된 언어 모델링을 통해 높은 품질의 텍스트 모델링을 유지함으로써, 전역 대조 목표만을 사용함에도 불구하고 여러 생물의학 벤치마크에서 최고 성능을 기록한다. 이는 영상 분할 및 방사선 검사 보고서 이해와 같은 과제에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Multi-modal data abounds in biomedicine, such as radiology images and reports. Interpreting this data at scale is essential for improving clinical care and accelerating clinical research. Biomedical text with its complex semantics poses additional challenges in vision--language modelling compared to the general domain, and previous work has used insufficiently adapted models that lack domain-specific language understanding. In this paper, we show that principled textual semantic modelling can substantially improve contrastive learning in self-supervised vision--language processing. We release a language model that achieves state-of-the-art results in radiology natural language inference through its improved vocabulary and novel language pretraining objective leveraging semantics and discourse characteristics in radiology reports. Further, we propose a self-supervised joint vision--language approach with a focus on better text modelling. It establishes new state of the art results on a wide range of publicly available benchmarks, in part by leveraging our new domain-specific language model. We release a new dataset with locally-aligned phrase grounding annotations by radiologists to facilitate the study of complex semantic modelling in biomedical vision--language processing. A broad evaluation, including on this new dataset, shows that our contrastive learning approach, aided by textual-semantic modelling, outperforms prior methods in segmentation tasks, despite only using a global-alignment objective.

연구 동기 및 목표

  • 생물의학 영상-언어 사전학습에서 부적절한 텍스트 모델링으로 인한 공동 표현 품질 저하 문제를 해결하기 위해.
  • 원칙적인 텍스트 의미 모델링에 초점을 맞춰 방사선학에서 자기지도 학습 영상-언어 학습을 향상시키기 위해.
  • 도메인 적응된 어휘와 논의 및 의미 구조를 통합한 새로운 사전학습 목적함수를 갖춘 방사선학 전용 언어 모델(CXR-BERT)을 개발하기 위해.
  • 복잡한 의미적 추론을 위한 방사선의사가 애너테이션한 문장 수준의 기준 정보를 포함한 새로운 데이터셋을 공개하기 위해.
  • 공동 학습 중 고정밀도 텍스트 모델링을 유지할 경우 분류 및 분할 과제에서 더 우수한 최종 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 방사선 보고서에 특화된 맞춤형 30,000 토큰 WordPiece 어휘를 사용하여, CXR-BERT라는 도메인 특화 BERT 기반 언어 모델을 처음부터 사전학습한다.
  • 세 단계 사전학습 전략을 적용한다: (1) 어휘 학습, (2) 일반 방사선 텍스트에서 동적 전체단어 마스킹을 사용한 마스크된 언어 모델링(MLM), (3) MIMIC-CXR에서 RSM 손실을 추가로 적용하여 표현 정렬을 위한 계속된 사전학습.
  • 전역 대비 목표를 사용하여 영상 및 텍스트 표현을 공동 최적화하는 대비 학습 프레임워크(BioViL)에 CXR-BERT를 통합한다.
  • 공동 이미지-텍스트 사전학습 중 MLM 손실을 유지하여 언어 모델 품질을 보존하고 다중 모odal 미세조정에 의한 품질 저하를 방지한다.
  • 모odal별 데이터 증강 기법을 적용한다: 영상에 대해 애핀 변환, 색상 왜곡, 차폐를, 텍스트에 대해 문장 재정렬을 통한 텍스트 증강을 적용하여 강건성 향상.
  • ResNet50 특징을 128차원 영상 표현으로 매핑하기 위해 2층의 1×1 컨volutional 프로젝션 헤드를 사용하며, 텍스트 특징에도 유사한 헤드를 적용한다.

실험 결과

연구 질문

  • RQ1원칙적인 텍스트 의미 모델링이 생물의학 분야에서 자기지도 학습 영상-언어 학습을 크게 향상시킬 수 있는가?
  • RQ2공동 학습 중 고정밀도 언어 모델링을 유지할 경우 공동 표현 및 최종 표현 품질이 향상되는가?
  • RQ3논의 인식 사전학습 목적함수를 갖춘 도메인 특화 언어 모델이 일반 도메인 또는 PubMed 기반 모델보다 방사선학 VLP 과제에서 얼마나 뛰어나게 성능을 내는가?
  • RQ4전역 대조 목표만을 사용하는 대비 학습 프레임워크가 뛰어난 텍스트 모델링을 통해 생물의학 분할 및 분류 과제에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5텍스트 모델링의 품질은 폐렴이나 기흉과 같은 희귀 또는 복잡한 소견에 대한 시각-언어 모델의 일반화 및 강건성에 어떤 영향을 미치는가?

주요 결과

  • CXR-BERT는 방사선학 자연어 추론 벤치마크에서 PubMedBERT 및 CheXpert 기반 베이스라인 모델을 능가하는 최신 기술 수준 성능을 기록한다.
  • BioViL은 CheXpert, MIMIC-CXR, NIH ChestX-ray14를 포함한 여러 공개 생물의학 영상-언어 벤치마크에서 최신 기술 수준 결과를 달성한다. 이는 전역 대비 목표만을 사용함에도 불구하고 성과이다.
  • 제거 실험 결과에 따르면, 공동 학습 중 MLM 손실을 유지한 경우 CheXpert에서 0-샷 분류 정확도가 3.5%p 향상되어, 텍스트 손실을 제거한 모델보다 우수한 성능을 보였다.
  • 제안된 방법은 새로 공개된 방사선의사가 애너테이션한 문장 수준 기준 데이터셋에서 평균 Dice 스코어를 4.2%p 향상시켜, 더 뛰어난 의미 기반 기준 설정 능력을 입증했다.
  • 희귀 소견에 대한 강건성이 향상되어, 폐렴 및 기흉과 같은 조건에서 기준 모델 대비 거짓 음성 수를 22% 감소시켰다.
  • 지역적으로 정렬된 문장 기준 애너테이션을 포함한 새로운 데이터셋의 공개는 향후 방사선 보고서에서 세밀한 의미 기반 정렬 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.