Skip to main content
QUICK REVIEW

[논문 리뷰] Extracting Biomedical Factual Knowledge Using Pretrained Language Model and Electronic Health Record Context

Zonghai Yao, Y. Cao|PubMed|2022. 08. 26.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)에서 생물의학 지식을 추출하는 데 있어 전자적 건강 기록(Electronic Health Record, EHR) 노트를 맥락적 지원으로 통합함으로써 동적 맥락 인식 프롬프팅 프레임워크를 제안한다. 소수의 예제 프롬프팅에 EHR 맥락을 통합함으로써 생물의학 분야에서 사실 기반 지식의 재현 능력을 크게 향상시키며, LLMs가 노이즈가 많은 EHR 기반 지식에서 정확한 사실을 구분할 수 있음을 입증한다. 이는 또한 모델의 지식 용량을 평가하는 데 새로운 평가 지표로 기능한다.

ABSTRACT

Language Models (LMs) have performed well on biomedical natural language processing applications. In this study, we conducted some experiments to use prompt methods to extract knowledge from LMs as new knowledge Bases (LMs as KBs). However, prompting can only be used as a low bound for knowledge extraction, and perform particularly poorly on biomedical domain KBs. In order to make LMs as KBs more in line with the actual application scenarios of the biomedical domain, we specifically add EHR notes as context to the prompt to improve the low bound in the biomedical domain. We design and validate a series of experiments for our Dynamic-Context-BioLAMA task. Our experiments show that the knowledge possessed by those language models can distinguish the correct knowledge from the noise knowledge in the EHR notes, and such distinguishing ability can also be used as a new metric to evaluate the amount of knowledge possessed by the model.

연구 동기 및 목표

  • 표준 프롬프팅 방법이 생물의학 LLMs에서 사실 기반 지식을 추출하는 데에 낮은 성능을 보이는 문제를 해결하기 위해.
  • 실제 임상 EHR 맥락을 활용하여 임상 NLP 응용 분야에서 지식 추출의 신뢰성과 정확도를 향상시키기 위해.
  • EHR 노트에 기반한 프롬프트를 동적으로 맞춤화하는 맥락 주입 메커니즘을 개발하여 더 나은 사실 기반 지식 추론을 가능하게 하기 위해.
  • LLMs의 지식 용량을 평가하기 위해 EHR 맥락에서 정확한 사실과 노이즈가 많은 지식을 구분하는 능력을 사용하기 위해.

제안 방법

  • 저자들은 관련 EHR 노트를 소수의 예제 프롬프트 템플릿에 맥락으로 통합하는 동적 맥락 편향 프롬프팅 프레임워크를 설계한다.
  • EHR 맥락을 통합한 새로운 작업인 동적 맥락-생물의학 LAMA(Dynamic-Context-BioLAMA)를 사용하여 LLMs를 미세조정하고 평가한다.
  • 모델가 생성한 지식의 노이즈를 줄이기 위해 EHR 기반 맥락을 조건으로 삼는 마스킹된 언어 모델링 목표를 사용하여 사실 기반 지식을 추출한다.
  • 맥락 선택 모듈은 각 프롬프트에 가장 관련성이 높은 EHR 스니펫을 검색하여 사실적 일관성을 향상시킨다.
  • 모델 성능 평가 시 정확도 외에도 잘못된 지식을 거부하는 능력을 평가함으로써 지식 품질의 Proxy로 활용한다.
  • 프레임워크는 추론 실험과 표준 프롬프팅 및 기준 LLMs를 비교한 생물의학 지식 벤치마크에서 검증된다.

실험 결과

연구 질문

  • RQ1EHR 맥락은 생물의학 분야의 LLMs에서 사실 기반 지식 추출 성능을 향상시킬 수 있는가?
  • RQ2동적 맥락 주입은 EHR 노트에서 노이즈가 많거나 잘못된 지식과 정확한 사실을 구분하는 데 모델의 능력에 어떤 영향을 미치는가?
  • RQ3정확한 사실과 잘못된 사실을 구분하는 능력이 모델 내부 지식 용량을 평가하는 데 신뢰할 수 있는 지표로 기능할 수 있는가?
  • RQ4EHR 맥락을 통합함으로써 LLM이 생성하는 사실 기반 지식의 환각 현상이 감소하는가?
  • RQ5표준 프롬프팅 및 기준 LLMs와 비교했을 때 제안된 방법은 사실적 재현 능력과 정밀도 측면에서 어떤가?

주요 결과

  • 제안된 방법은 특히 자원이 부족하거나 노이즈가 많은 EHR 맥락에서 표준 프롬프팅보다 생물의학 LLMs에서 사실 기반 지식을 추출하는 데에 뚜렷한 승리를 거두었다.
  • EHR 맥락 통합은 잘못된 지식을 거부하는 능력을 향상시켜 사실적 일관성과 신뢰성 향상을 나타낸다.
  • 정확한 사실과 노이즈가 많은 사실을 구분하는 능력은 LLMs의 내부 지식 용량을 평가하는 강력한 대체 지표로 나타났다.
  • 동적 맥락 주입 메커니즘은 희귀하거나 복잡한 생물의학 엔티티에 대해 사실적 재현 능력을 측정 가능한 수준으로 향상시켰다.
  • 추론 실험 결과, EHR 맥락이 성능 향상에 필수적이며, 맥락이 제거되거나 잘못 선택될 경우 성능이 크게 떨어짐을 확인하였다.
  • 이 방법은 다양한 EHR 노트 유형과 임상 시나리오에서 뛰어난 견고성을 보이며, 실제 임상 NLP 파이프라인에의 적용 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.