Skip to main content
QUICK REVIEW

[논문 리뷰] MapperGPT: Large Language Models for Linking and Mapping Entities

Nicolas Matentzoglu, J. Harry Caufield|arXiv (Cornell University)|2023. 10. 05.
Topic ModelingComputer Science인용 수 3
한 줄 요약

MapperGPT는 어휘적 및 구조적 히وري스틱 기반으로 생성된 저해상도, 고재현율 엔티티 매핑을 대규모 언어 모델(Large Language Models, LLMs)을 활용해 정밀도를 향상시켜, 해부학, 발달생물학, 신장 질환과 같은 생물의학 분야의 교차 온톨로지 정렬 작업에서 정확도를 크게 향상시킨다. 이는 LLM 기반의 추론을 통해 엔티티의 의미와 맥락을 분석함으로써 오진 양성률을 감소시켜 최신 기술인 LogMap을 초월한다.

ABSTRACT

Aligning terminological resources, including ontologies, controlled vocabularies, taxonomies, and value sets is a critical part of data integration in many domains such as healthcare, chemistry, and biomedical research. Entity mapping is the process of determining correspondences between entities across these resources, such as gene identifiers, disease concepts, or chemical entity identifiers. Many tools have been developed to compute such mappings based on common structural features and lexical information such as labels and synonyms. Lexical approaches in particular often provide very high recall, but low precision, due to lexical ambiguity. As a consequence of this, mapping efforts often resort to a labor intensive manual mapping refinement through a human curator. Large Language Models (LLMs), such as the ones employed by ChatGPT, have generalizable abilities to perform a wide range of tasks, including question-answering and information extraction. Here we present MapperGPT, an approach that uses LLMs to review and refine mapping relationships as a post-processing step, in concert with existing high-recall methods that are based on lexical and structural heuristics. We evaluated MapperGPT on a series of alignment tasks from different domains, including anatomy, developmental biology, and renal diseases. We devised a collection of tasks that are designed to be particularly challenging for lexical methods. We show that when used in combination with high-recall methods, MapperGPT can provide a substantial improvement in accuracy, beating state-of-the-art (SOTA) methods such as LogMap.

연구 동기 및 목표

  • 생물의학 데이터 통합에서 어휘적 및 구조적 엔티티 매핑 방법의 낮은 정밀도 문제를 해결하기 위해.
  • 수동 쿠리에이션에 의존하는 것을 줄이고, LLM을 활용해 매핑 정밀도를 자동화하기 위해.
  • 해부학, 발달생물학, 신장 질환을 포함한 다양한 분야에서 엔티티 정렬의 정확도를 향상시키기 위해.
  • 히وري스틱 기반 도구가 생성한 매핑의 후처리 단계에서 LLM의 효과를 평가하기 위해.

제안 방법

  • MapperGPT는 어휘적 및 구조적 특징에 의존하는 고재현율 엔티티 매핑 도구의 결과를 바탕으로 LLM을 후처리 단계로 통합한다.
  • 엔티티 쌍, 레이블, 동의어, 맥락적 메타데이터를 LLM에 입력하여 진짜 대응 관계인지 평가한다.
  • LLM은 의미적 및 맥락적 추론에 기반해 이진 판단(매칭 또는 비매칭)을 생성하여 오진 양성률을 걸러낸다.
  • 다양한 도메인 특화 정렬 작업을 대상으로 평가하며, 정밀도 및 F1 점수를 측정하기 위해 정제된 테스트 세트를 사용한다.
  • 모델 파인튜닝 없이도 도메인 특화 매핑 과제에 적응할 수 있도록 제로샷 또는 희소샷 프롬프팅 전략을 활용한다.
  • 기존 매핑 파이프라인의 핵심 로직을 변경하지 않고도 통합이 가능한 모듈식 아키텍처로 설계되어 있다.

실험 결과

연구 질문

  • RQ1LLM은 생물의학 엔티티 정렬에서 고재현율 어휘적 및 구조적 히وري스틱이 생성한 오진 양성률 매핑을 효과적으로 줄일 수 있는가?
  • RQ2다양한 생물의학 도메인에서 최신 기술인 LogMap과 비교해 LLM 기반 정밀도 향상 방식은 정밀도 및 F1 점수 측면에서 어떻게 성능을 내는가?
  • RQ3모델 파인튜닝 없이도 LLM은 다양한 온톨로지 및 용어 체계 간에 얼마나 일반화할 수 있는가?
  • RQ4어휘 유사도를 넘어서 맥락적 및 의미적 단서가 매핑 정확도 향상에 어떤 역할을 하는가?
  • RQ5LLM의 통합은 대규모 엔티티 매핑 워크플로우의 확장성과 실용성에 어떤 영향을 미치는가?

주요 결과

  • MapperGPT는 기초 어휘적 및 구조적 방법에 비해 매핑 정밀도를 크게 향상시켜 모든 평가 도메인에서 높은 F1 점수를 달성한다.
  • LogMap과 비교해 복잡한 매핑 과제, 특히 어휘적 모호성을 포함한 과제에서 뛰어난 성능을 보인다.
  • LLM 기반 정밀도 향상 단계는 오진 양성률을 효과적으로 줄이며 높은 재현율을 유지함으로써 다양한 생물의학 온톨로지 간에 강력한 일반화 능력을 입증한다.
  • 제로샷 프롬프팅 조건에서도 높은 성능을 유지함으로써 모델 파인튜닝 없이도 도메인 이동에 대해 강건함을 입증한다.
  • 기존 매핑 파이프라인에 LLM을 통합함으로써 수동 쿠리에이션의 필요성을 줄여 노동 집약적인 정밀도 향상 과정에 비해 확장 가능한 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.