Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Large Language Models for Ontology Alignment

Yuan He, Jiaoyan Chen|arXiv (Cornell University)|2023. 09. 12.
Biomedical Text Mining and Ontologies인용 수 6
한 줄 요약

이 논문은 프롬프트 기반 프레임워크를 통해 개념 레이블과 구조적 맥락(부모/자식 관계)을 활용하여 의미적 동치성을 식별함으로써, Flan-T5-XXL 및 GPT-3.5-turbo와 같은 대규모 언어 모델(LLM)을 사용한 zero-shot 온톨로지 정렬을 조사한다. 결과적으로, 임계값 설정을 적용한 Flan-T5-XXL는 NCIT-DOID 서브셋에서 F-스코어 0.721을 기록하여 BERTMap보다 F-스코어에서 뛰어나며, 적절히 프롬프트된 LLM이 온톨로지 매칭에 잠재력을 지닌다는 것을 보여준다.

ABSTRACT

This work investigates the applicability of recent generative Large Language Models (LLMs), such as the GPT series and Flan-T5, to ontology alignment for identifying concept equivalence mappings across ontologies. To test the zero-shot performance of Flan-T5-XXL and GPT-3.5-turbo, we leverage challenging subsets from two equivalence matching datasets of the OAEI Bio-ML track, taking into account concept labels and structural contexts. Preliminary findings suggest that LLMs have the potential to outperform existing ontology alignment systems like BERTMap, given careful framework and prompt design.

연구 동기 및 목표

  • 프롬프팅을 통해 미세조정 없이 대규모 언어 모델(LLM)을 사용한 zero-shot 온톨로지 정렬의 가능성 평가
  • 개념 레이블과 구조적 맥락(예: 부모/자식 관계)이 LLM 기반 매칭 성능에 미치는 영향 탐구
  • 어려운 비트레이스러운 온톨로지 정합 서브셋에서 기존의 기준 모델인 BERTMap 및 BERTMapLt와의 성능 비교
  • LLM으로부터 신뢰할 수 있는 예/아니요 예측을 추출하는 데 발생하는 주요 과제 파악 및 의미적 동치성 탐지에 최적화된 프롬프트 설계 최적화
  • 철저한 프레임워크 및 프롬프트 엔지니어링를 통해 기존 방법을 능가할 잠재력을 지닌 LLM의 온톨로지 정합 가능성 탐색

제안 방법

  • LLM이 소스 및 타겟 온톨로지의 개념 이름과 계층적 맥락을 바탕으로 두 개념 간에 동치인지 여부를 분류하도록 하는 zero-shot 프롬프팅 프레임워크 설계
  • 구조화된 입력을 포함: 소스 및 타겟 개념의 개념 레이블, 부모 개념, 자식 개념
  • 모델의 출력은 이진 분류로 간주되며, '예'는 동치성, '아니요'는 비동치성으로 해석되며, '예' 토큰의 확률은 신뢰도 점수로 사용됨
  • 낮은 신뢰도의 '예' 예측을 걸러내기 위해 임계값 설정을 적용하여 정밀도를 향상시키되, 재현율은 감소함
  • 부모 및 자식 개념 이름을 추가 맥락으로 통합하여 모델의 구조적 관계 이해를 향상시킴
  • 표준 온톨로지 매칭 메트릭을 사용해 평가: 정밀도, 재현율, F-스코어, Hits@1, MRR, RR; OAEI 생물정보학 기반 기계학습 트랙의 두 어려운 서브셋을 대상으로

실험 결과

연구 질문

  • RQ1Flan-T5-XXL 및 GPT-3.5-turbo와 같은 LLM이 미세조정 없이 zero-shot 온톨로지 정합에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2부모 및 자식 개념과 같은 구조적 맥락을 통합할 경우, LLM 기반 온톨로지 정합의 정확도에 어떤 영향을 미치는가?
  • RQ3LLM의 출력 점수에 임계값을 적용하면 매핑 예측의 정밀도-재현율 트레이드오���에서 성능 향상이 이루어지는가?
  • RQ4비트레이스러운, 문자 매칭 제외된 데이터셋에서 LLM 기반 시스템은 최신 기준 모델인 BERTMap 및 BERTMapLt와 비교해 어떻게 성능을 내는가?
  • RQ5LLM으로부터 온톨로지 정합 작업을 위한 신뢰할 수 있는 이진 예측을 추출하는 데 발생하는 주요 과제는 무엇인가?

주요 결과

  • Flan-T5-XXL에 임계값 설정을 적용한 결과, NCIT-DOID 서브셋에서 F-스코어 0.721을 기록하여 BERTMap의 F-스코어 0.628을 초월함
  • SNOMED-FMA (Body) 서브셋에서 Flan-T5-XXL에 임계값 설정을 적용한 결과, F-스코어 0.346을 기록하여 BERTMapLt(0.395)를 뛰어넘고 BERTMap(0.552)에 가까워짐
  • 임계값 설정으로 NCIT-DOID 서브셋에서 정밀도는 0.643에서 0.861로 향상되었지만, 재현율은 0.720에서 0.620으로 감소함
  • 부모/자식 맥락 통합은 성능 향상에 기여하지 않았고, 때로는 F-스코어를 감소시켜 현재의 맥락 통합 전략이 최적화되어 있지 않음을 시사함
  • GPT-3.5-turbo는 열악한 성능(F-스코어 0.132)을 보였으며, 이는 약한 설명과 확률 추출 불가로 인해 이진 응답을 신뢰할 수 없었기 때문일 것임
  • BERTMapLt는 예상대로 문자 매칭 제외 서브셋에서 성능이 열등했으며, 이는 편집 유사도에 의존하기 때문임

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.