Skip to main content
QUICK REVIEW

[논문 리뷰] Language Models sounds the Death Knell of Knowledge Graphs

Kunal Suri, Atul K. Singh|arXiv (Cornell University)|2023. 01. 10.
Biomedical Text Mining and Ontologies인용 수 4
한 줄 요약

이 논문은 생물의학 분야의 대규모 언어 모델(Large Language Models, LLMs)인 BioBERT와 Med-BERT가 자기지도 학습을 통해 도메인 지식을 암묵적으로 인코딩함으로써 수동으로 구축된 지식 그래프를 대체할 수 있으며, 엔티티 인식 및 질문 응답과 같은 작업에서 수동 코어티네이션 없이도 유사한 성능을 달성할 수 있다고 주장한다. 주요 기여는 LLMs가 정확도와 효율성 면에서 전통적인 지식 그래프 기반 시스템을 능가하거나 그에 맞추어 성능을 내는 경험적 증거를 제시한 것으로, 많은 의료 NLP 응용 분야에서 기존의 지식 그래프가 더 이상 필요하지 않게 되었다는 것을 시사한다.

ABSTRACT

Healthcare domain generates a lot of unstructured and semi-structured text. Natural Language processing (NLP) has been used extensively to process this data. Deep Learning based NLP especially Large Language Models (LLMs) such as BERT have found broad acceptance and are used extensively for many applications. A Language Model is a probability distribution over a word sequence. Self-supervised Learning on a large corpus of data automatically generates deep learning-based language models. BioBERT and Med-BERT are language models pre-trained for the healthcare domain. Healthcare uses typical NLP tasks such as question answering, information extraction, named entity recognition, and search to simplify and improve processes. However, to ensure robust application of the results, NLP practitioners need to normalize and standardize them. One of the main ways of achieving normalization and standardization is the use of Knowledge Graphs. A Knowledge Graph captures concepts and their relationships for a specific domain, but their creation is time-consuming and requires manual intervention from domain experts, which can prove expensive. SNOMED CT (Systematized Nomenclature of Medicine -- Clinical Terms), Unified Medical Language System (UMLS), and Gene Ontology (GO) are popular ontologies from the healthcare domain. SNOMED CT and UMLS capture concepts such as disease, symptoms and diagnosis and GO is the world's largest source of information on the functions of genes. Healthcare has been dealing with an explosion in information about different types of drugs, diseases, and procedures. This paper argues that using Knowledge Graphs is not the best solution for solving problems in this domain. We present experiments using LLMs for the healthcare domain to demonstrate that language models provide the same functionality as knowledge graphs, thereby making knowledge graphs redundant.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models)이 의료 NLP에서 수동으로 구축된 지식 그래프의 필요성을 제거할 수 있는지 평가하는 것.
  • 표준 의료 NLP 작업에서 전통적인 지식 그래프 기반 시스템과의 성능을 LLMs와 비교하는 것.
  • 대규모 텍스트 코퍼스에 대한 자기지도 학습을 통해 충분한 도메인 지식이 암묵적으로 내장되어 있어 명시적인 지식 그래프를 대체할 수 있음을 보여주는 것.
  • LLM의 능력 고려 시, SNOMED CT나 UMLS와 같은 온톨로지의 수동 코어티네이션을 위한 높은 비용과 노동 강도가 더 이상 정당화되지 않는다는 주장을 펼치는 것.
  • LLMs가 의료 정보 추출 및 질문 응답에서 지식 그래프 보강 시스템과 비교해 유사하거나 더 나은 결과를 내는 경험적 증거를 제공하는 것.

제안 방법

  • 자기지도 학습을 사용하여 대규모 비정형 의료 텍스트 코퍼스(예: BioBERT, Med-BERT)에 대해 대규모 언어 모델을 사전 학습하는 것.
  • 이를 바탕으로 명명된 엔티티 인식, 질문 응답, 정보 추출과 같은 하류 의료 NLP 작업에 대해 사전 학습된 LLMs를 미세 조정하는 것.
  • SNOMED CT, UMLS, 유전체 온톨로지(Gene Ontology)와 같은 외부 지식 그래프에 의존하는 시스템과의 성능을 비교 평가하는 것.
  • 제로샷 및 피어샷 프롬프팅을 사용하여 모델이 명시적인 그래프 구조 없이도 관계를 유추할 수 있는 능력을 평가하는 것.
  • 골드 스탠다드 애너테이션과 비교하여 모델 출력의 정확도와 실제 임상 환경에서의 강건성을 측정하는 것.
  • LLM 가중치에 암묵적으로 저장된 지식을 분석하여, 명시적인 지식 그래프와 동일한 의미 관계를 포괄하고 있는지 평가하는 것.

실험 결과

연구 질문

  • RQ1대규모 언어 모델은 의료 NLP 작업에서 지식 그래프 보강 시스템과 유사한 성능을 낼 수 있는가?
  • RQ2LLMs는 어느 정도 의료 지식을 암묵적으로 내장하여 명시적인 지식 그래프의 필요성을 줄이는가?
  • RQ3임상 텍스트에서 명명된 엔티티 인식 및 질문 응답 작업에서 LLMs의 성능은 지식 그래프 기반 시스템과 어떻게 비교되는가?
  • RQ4대규모 의료 코퍼스에 대한 자기지도 학습을 통해 SNOMED CT나 UMLS와 같은 온톨로지의 수동 코어티네이션 필요성이 제거되는가?
  • RQ5LLMs는 구조화된 지식 그래프에 의존하지 않고도 새로운 의료 개념과 관계에 일반화할 수 있는가?

주요 결과

  • BioBERT 및 Med-BERT와 같은 대규모 언어 모델은 명명된 엔티티 인식 및 질문 응답 작업에서 지식 그래프 보강 시스템과 동등하거나 그 이상의 성능을 달성한다.
  • LLM 가중치에 암묵적으로 저장된 지식 덕분에 명시적인 그래프 구조 없이도 의료 관계의 정확한 추론이 가능해져 수동 코어티네이션 의존도가 감소한다.
  • LLMs는 강력한 피어샷 및 제로샷 일반화 능력을 보이며, 외부 지식 기반의 업데이트 없이도 드문 또는 알려지지 않은 의료 엔티티를 효과적으로 처리할 수 있다.
  • 이 연구는 SNOMED CT나 UMLS와 같은 지식 그래프를 구축하고 유지하는 데 드는 비용과 노력이 LLM의 성능과 확장성 고려 시 더 이상 정당화되지 않는다고 발견했다.
  • 경험적 결과로 LLMs가 공식 온톨로지 없이도 의료 개념과 그 관계를 높은 정확도로 추출하고 추론할 수 있음을 보여주었다.
  • 저자들은 LLM의 뛰어난 확장성과 성능을 고려할 때 지식 그래프가 많은 의료 NLP 응용 분야에서 더 이상 필요하지 않게 되었다고 결론 내렸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.