Skip to main content
QUICK REVIEW

[논문 리뷰] MedCPT: Contrastive Pre-trained Transformers with Large-scale PubMed Search Logs for Zero-shot Biomedical Information Retrieval

Qiao Jin, Won Bae Kim|arXiv (Cornell University)|2023. 07. 02.
Topic Modeling참고 문헌 64인용 수 9
한 줄 요약

MedCPT는 255 million PubMed 클릭 로그를 이용해 대조적으로 사전 학습된 트랜스포머 모델을 도입하여 zero-shot 의미 생물 의학 정보 검색을 가능하게 하고, six 가지 과제에서 최첨단 결과를 달성한다.

ABSTRACT

Information retrieval (IR) is essential in biomedical knowledge acquisition and clinical decision support. While recent progress has shown that language model encoders perform better semantic retrieval, training such models requires abundant query-article annotations that are difficult to obtain in biomedicine. As a result, most biomedical IR systems only conduct lexical matching. In response, we introduce MedCPT, a first-of-its-kind Contrastively Pre-trained Transformer model for zero-shot semantic IR in biomedicine. To train MedCPT, we collected an unprecedented scale of 255 million user click logs from PubMed. With such data, we use contrastive learning to train a pair of closely-integrated retriever and re-ranker. Experimental results show that MedCPT sets new state-of-the-art performance on six biomedical IR tasks, outperforming various baselines including much larger models such as GPT-3-sized cpt-text-XL. In addition, MedCPT also generates better biomedical article and sentence representations for semantic evaluations. As such, MedCPT can be readily applied to various real-world biomedical IR tasks.

연구 동기 및 목표

  • zero-shot 의미 생물 의학 정보 검색 없이 풍부한 질의-기사 주석 없이 동기를 부여한다.
  • 대규모 PubMed 사용자 클릭 로그를 활용하여 대조적 검색 프레임워크를 학습한다.
  • 생물의학에서 더 향상된 의미 검색을 위한 tightly integrated retriever and re-ranker를 개발한다.
  • 기준선 및 훨씬 큰 모델들보다 다수의 생물의학 IR 과제에서 우수한 성능을 입증한다.

제안 방법

  • 대상 조회하에 retriever와 re-ranker로 구성된 대조적 이중 컴포넌트 모델을 학습한다.
  • 255 million PubMed 사용자 클릭 로그를 대조적 학습의 감독 신호로 사용한다.
  • 질의 표현과 기사 표현을 정렬하기 위해 대조적 손실로 최적화한다.
  • 기사 수준 및 문장 수준의 의미 작업에서 표현을 평가한다.
  • GPT-3-sized CPT-text-XL 등 대규모 모델을 포함한 baselines와의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1대규모 PubMed 검색 로그에 대한 대조적 사전 학습으로 zero-shot 생물의학 IR을 달성할 수 있는가?
  • RQ2클릭 데이터로 학습된 retriever–re-ranker 구조가 생물의학 IR 과제에서 렉시컬 베이스라인 및 더 큰 모델보다 우수한가?
  • RQ3학습된 표현이 생물의학에서 기사 수준과 문장 수준 모두에서 의미 검색을 향상시키는가?

주요 결과

  • MedCPT가 여섯 가지 생물의학 IR 과제에서 새로운 최첨단 성능을 달성한다.
  • MedCPT는 GPT-3-sized CPT-text-XL를 포함한 다양한 베이스라인을 능가한다.
  • MedCPT는 의미 평가를 위한 생의학적 기사 및 문장 표현을 더 잘 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.