[논문 리뷰] Large Language Models for Biomedical Knowledge Graph Construction: Information extraction from EMR notes
이 논문은 전자 의료 기록(EMR) 노트에서 생물의학 지식 그래프를 자동으로 구성하기 위해 대규모 언어 모델(LLM)을 사용하는 엔드 투 엔드 방법을 제안한다. 주로 질병, 치료법, 요인 및 증상 간의 관계에 초점을 맞추며, 다양한 아키텍처를 가진 12개의 LLM을 평가하여 디코더 온리 모델은 구조화된 출력을 위해 가이드드 프롬프팅이 필요하다는 점을 발견하고, 수작업으로 애너테이션된 데이터셋을 사용하여 노화 관련 망막변성에 대한 접근을 시연한다.
The automatic construction of knowledge graphs (KGs) is an important research area in medicine, with far-reaching applications spanning drug discovery and clinical trial design. These applications hinge on the accurate identification of interactions among medical and biological entities. In this study, we propose an end-to-end machine learning solution based on large language models (LLMs) that utilize electronic medical record notes to construct KGs. The entities used in the KG construction process are diseases, factors, treatments, as well as manifestations that coexist with the patient while experiencing the disease. Given the critical need for high-quality performance in medical applications, we embark on a comprehensive assessment of 12 LLMs of various architectures, evaluating their performance and safety attributes. To gauge the quantitative efficacy of our approach by assessing both precision and recall, we manually annotate a dataset provided by the Macula and Retina Institute. We also assess the qualitative performance of LLMs, such as the ability to generate structured outputs or the tendency to hallucinate. The results illustrate that in contrast to encoder-only and encoder-decoder, decoder-only LLMs require further investigation. Additionally, we provide guided prompt design to utilize such LLMs. The application of the proposed methodology is demonstrated on age-related macular degeneration.
연구 동기 및 목표
- EMR 노트에서 생물의학 지식 그래프를 자동으로 구성하기 위한 엔드 투 엔드 기계학습 솔루션 개발.
- 임상 관계 추출 작업에서 다양한 12개의 LLM 아키텍처의 성능과 안전성 평가.
- 의료 NLP 분야에서 디코더 온리 LLM의 구조화된 출력 생성 과제 해결.
- 디코더 온리 LLM의 지식 그래프 구성에 대한 유용성을 향상시키기 위한 가이드드 프롬프팅 설계 프레임워크 제공.
- 수작업으로 애너테이션된 데이터셋을 사용하여 노화 관련 망막변성에 대한 방법의 적용 가능성 시연.
제안 방법
- EMR 노트에서 관계 추출을 위해 다양한 아키텍처(에코더 온리, 에코더-디코더, 디코더 온리)를 가진 12개의 LLM을 사용.
- 맥울라 및 레티나 인스티튜트에서 제공한 수작업으로 애너테이션된 비공개 데이터셋을 사용하여 임상 관계 추출 성능을 벤치마킹.
- 지시 기반 및 희소 few-shot 프롬프팅 전략을 적용하여 구조화된 출력 생성을 향상시키며, 특히 디코더 온리 모델에 초점을 맞춤.
- 질병, 치료법, 요인 및 증상 간의 방향성 있는 관계인 'coexists_with'를 추출하는 데 집중.
- 정량적 평가(Precision, Recall)와 정성적 분석(허구, 출력 구조)을 통해 LLM의 행동을 평가.
- EMR 노트를 처리하여 실체와 관계를 식별하고, 노드와 레이블된 간선을 가진 방향성 있는 지식 그래프를 구성하는 파이프라인을 사용.
실험 결과
연구 질문
- RQ1어떤 LLM 아키텍처가 EMR 노트에서 구조화된 의료 관계를 추출하는 데 가장 잘 성능을 내는가?
- RQ2다양한 LLM 아키텍처는 임상 관계 추출에서 정밀도, 재현도 및 허구 비율 측면에서 어떻게 비교되는가?
- RQ3가이드드 프롬프팅은 디코더 온리 LLM이 지식 그래프 구성에 적합한 구조화된 출력을 생성하도록 효과적으로 가능하게 하는가?
- RQ4LLM을 임상 지식 그래프 구성에 배포할 때의 안전성 및 신뢰성 문제는 무엇인가?
- RQ5제안된 방법은 노화 관련 망막변성과 같은 특정 질환에 대해 지식 그래프를 구성하는 데 얼마나 효과적인가?
주요 결과
- 디코더 온리 LLM은 지식 그래프 구성에 적합한 구조화된 출력을 생성하기 위해 가이드드 프롬프팅이 필요하며, 이는 에코더 온리 및 에코더-디코더 모델과 다릅니다.
- FLAN-T5-XXL 및 FLAN-UL2 모델은 지시 기반 및 희소 few-shot 프롬프팅을 통해 여러 테스트 케이스에서 정확한 관계 추출 성능을 보였습니다.
- 공개 데이터셋(MIMIC-III 등)으로 미세조정된 모델는 편향되거나 일반화 능력이 떨어질 수 있으므로, 평가에 비공개 수작업 애너테이션 데이터셋을 사용했습니다.
- 가이드드 프롬프팅은 특히 디코더 온리 모델의 관계 추출의 신뢰성과 일관성에 크게 기여했습니다.
- 이 방법은 노화 관련 망막변성에 대해 지식 그래프를 성공적으로 구성했으며, 'AREDS 및 WACS 비타민'이 '근시성 망막변성'과 공존한다는 등의 핵심 관계를 식별했습니다.
- 정성적 분석 결과, 적절한 프롬프팅 없이 디코더 온리 모델에서는 허구 및 비구조화된 출력이 일반적인 문제로 나타났습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.