Skip to main content
QUICK REVIEW

[논문 리뷰] Rewire-then-Probe: A Contrastive Recipe for Probing Biomedical Knowledge of Pre-trained Language Models

Zaiqiao Meng, Fangyu Liu|arXiv (Cornell University)|2021. 10. 15.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 UMLS 메타테사우루스에서 유래한 보다 정교한 생물의학 지식 탐지 기준인 MedLAMA를 소개하고, 작업별 데이터를 사용하지 않고도 사전 훈련된 언어 모델의 사실 지식 탐지 성능을 향상시키는 자기지도 대비 미세조정 방법인 Contrastive-Probe를 제안한다. 이 방법은 acc@10에서 정확도를 3%에서 24%로 끌어올려 생물의학 PLM에 잠재된 지식의 잠재력이 크다는 것을 드러내며, UMLS에 포함된 지식 커버리지가 불완전하여 현재 평가 기준이 모델 성능을 과소 평가하고 있음을 시사한다.

ABSTRACT

Knowledge probing is crucial for understanding the knowledge transfer mechanism behind the pre-trained language models (PLMs). Despite the growing progress of probing knowledge for PLMs in the general domain, specialised areas such as biomedical domain are vastly under-explored. To catalyse the research in this direction, we release a well-curated biomedical knowledge probing benchmark, MedLAMA, which is constructed based on the Unified Medical Language System (UMLS) Metathesaurus. We test a wide spectrum of state-of-the-art PLMs and probing approaches on our benchmark, reaching at most 3% of acc@10. While highlighting various sources of domain-specific challenges that amount to this underwhelming performance, we illustrate that the underlying PLMs have a higher potential for probing tasks. To achieve this, we propose Contrastive-Probe, a novel self-supervised contrastive probing approach, that adjusts the underlying PLMs without using any probing data. While Contrastive-Probe pushes the acc@10 to 28%, the performance gap still remains notable. Our human expert evaluation suggests that the probing performance of our Contrastive-Probe is still under-estimated as UMLS still does not include the full spectrum of factual knowledge. We hope MedLAMA and Contrastive-Probe facilitate further developments of more suited probing techniques for this domain.

연구 동기 및 목표

  • 생물의학 분야에서 다중 토큰 엔티티와 복잡한 관계를 다룰 수 있는 전문화된 지식 탐지 기준의 부족을 해결하기 위해.
  • 최신 탐지 방법과 생물의학 PLM이 생물의학 지식 탐지 작업에서 성능이 떨어지는 이유를 조사하기 위해.
  • 라벨이 부여된 탐지 데이터가 필요 없이도 데이터 효율적이고 자기지도 방식으로 PLM의 지식 탐지 성능을 향상시키는 방법을 개발하기 위해.
  • 기존 기준(예: UMLS)이 사실 지식 커버리지가 불완전하거나 누락되어 있어 모델 성능을 과소 평가할 수 있는 정도를 평가하기 위해.
  • 현재 측정 지표가 시사하는 것보다 생물의학 PLM의 진정한 지식 용량이 더 높다는 것을 입증하기 위해, 특히 개선된 탐지 및 표현 기법을 사용할 경우에만 가능하다.

제안 방법

  • UMLS 메타테사우루스에서 유래한 19개의 관계와 19,000개의 질의를 포함한 생물의학 탐지 기준인 MedLAMA를 구축하고, 전문가의 검증을 거친다.
  • 질의 토큰 겹침을 기반으로 어려운 예와 쉬운 예를 설계하여 모델의 일반화 능력과 내성 강도를 평가한다.
  • 생물의학 텍스트에서 얻은 원시 문장(탐지 데이터가 아닌)만을 사용하여 PLM을 미세조정하는 자기지도 대비 미세조정 방법인 Contrastive-Probe를 제안한다.
  • 동일한 입력에 대한 양호한 및 열악한 시각 간의 일치도를 극대화함으로써 표현 공간을 재구성함으로써 사실 지식 인코딩을 향상시킨다.
  • 탐지 데이터에 대한 미세조정이 필요 없기 때문에, 다양한 생물의학 PLM(예: PubMedBERT, BioBERT)에 적용할 수 있으며, 서로 간의 공정한 비교를 가능하게 한다.
  • 모델 예측이 UMLS 기준에 비해 인간 전문가 평가를 통해 검토되었으며, 지식 기반의 누락으로 인해 유효한 모델 출력이 평가에서 제외되는 경우가 많다는 점을 확인했다.

실험 결과

연구 질문

  • RQ1일반 NLP 작업에서 우수한 성능을 보이는 상태의 최신 탐지 방법과 생물의학 PLM가 MedLAMA에서 3%의 acc@10 성능을 기록하는 이유는 무엇인가?
  • RQ2작업별 데이터를 사용하지 않고도 자기지도 대비 미세조정이 생물의학 PLM의 사실 지식 탐지 성능을 얼마나 향상시킬 수 있는가?
  • RQ3다른 트랜스포머 레이어는 어떻게 다른 종류의 사실 지식을 인코딩하는가? 이는 특정 관계 유형에서의 성능에 어떤 영향을 미치는가?
  • RQ4UMLS 지식 기반의 부족 또는 누락으로 인해 유효한 사실 지식이 과소 대비되는 정도는 어느 정도이며, 이로 인해 평가 지표가 지나치게 낙관적으로 평가되는가?
  • RQ5대비 전처리 방법이 생물의학 PLM의 잠재된 사실 지식을 효과적으로 해금할 수 있으며, 프롬프트 기반 또는 미세조정 접근 방식과 비교해 볼 때 어떤가?

주요 결과

  • MedLAMA 기준은 기존 탐지 방법이 생물의학 지식 탐지에서 3%의 acc@10 성능을 기록함으로써 전문 분야에서의 심각한 성능 저하를 드러낸다.
  • Contrastive-Probe는 자기지도 대비 미세조정을 통해 최고 성능의 acc@10를 3%에서 24%로 끌어올려, 탐지 데이터 없이도 상당한 성능 향상을 입증한다.
  • 다른 트랜스포머 레이어는 서로 다른 종류의 사실 지식을 인코딩하며, 일부 레이어는 '유전자 제품은 생화학적 기능을 가진다' 또는 '질병은 분자 이상을 가질 수 있다'와 같은 특정 관계 유형에서 더 뛰어난 성능을 보인다.
  • 인간 전문가 평가 결과, UMLS 지식 기반에 항목이 누락되어 있어 많은 유효한 모델 예측이 평가에서 제외되는 것으로 나타나, 현재 기준이 모델을 과도하게 낮게 평가하고 있음을 시사한다.
  • 생물의학 PLM의 진정한 지식 용량은 현재 측정된 수준을 초월한다. 대비 학습을 통한 표현 공간 최적화와 프롬프트 엔지니어링을 통한 입력 공간 최적화를 통해 잠재된 사실 지식을 더욱 효과적으로 해금할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.