Skip to main content
QUICK REVIEW

[논문 리뷰] LambdaKG: A Library for Pre-trained Language Model-Based Knowledge Graph Embeddings

Xin Xie, Zhoubo Li|arXiv (Cornell University)|2022. 10. 01.
Topic Modeling인용 수 5
한 줄 요약

LambdaKG는 사전 훈련된 언어 모델(PLM)을 사용한 지식 그래프 임베딩(KGE)을 위한 통합형 오픈소스 라이브러리로, 지식 그래프 보완, 질의 응답, 추천, 지식 탐색 등 다양한 작업에서 판별 기반 및 생성 기반 방법을 모두 지원한다. BERT, BART, T5, GPT-3, ChatGPT를 통합하여 모듈화되고 확장 가능한 프레임워크를 제공하며, 통합된 훈련, 평가 및 최적화 도구를 통해 FB15k-237 및 ATOMIC2020와 같은 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Knowledge Graphs (KGs) often have two characteristics: heterogeneous graph structure and text-rich entity/relation information. Text-based KG embeddings can represent entities by encoding descriptions with pre-trained language models, but no open-sourced library is specifically designed for KGs with PLMs at present. In this paper, we present LambdaKG, a library for KGE that equips with many pre-trained language models (e.g., BERT, BART, T5, GPT-3), and supports various tasks (e.g., knowledge graph completion, question answering, recommendation, and knowledge probing). LambdaKG is publicly open-sourced at https://github.com/zjunlp/PromptKG/tree/main/lambdaKG, with a demo video at http://deepke.zjukg.cn/lambdakg.mp4 and long-term maintenance.

연구 동기 및 목표

  • 사전 훈련된 언어 모델(PLM) 기반 지식 그래프 임베딩(KGE)에 특화된 종합적이고 오픈소스인 라이브러리가 부족한 문제를 해결하기 위해.
  • 판별 기반 및 생성 기반의 다양한 PLM 기반 KGE 방법을 하나의 확장 가능한 프레임워크로 통합하기 위해.
  • 지식 그래프 보완, 질의 응답, 추천, 지식 탐색 등 다양한 후행 작업을 지원하기 위해.
  • 표준화된 훈련, 평가 및 최적화 구성 요소를 갖춘 모듈식이고 유지보수 용이하며 확장 가능한 툴킷을 제공하여 재현 가능한 연구를 가능하게 하기 위해.
  • GPT-3 및 ChatGPT와 같은 최신 기술 수준의 PLM를 활용해 새로운 KGE 방법의 철저한 벤치마크 및 비교를 가능하게 하기 위해.

제안 방법

  • LambdaKG는 지식 그래프 트리플을 자연어 프롬프트로 변환하는 통합형 KG 인코더를 사용하여, PLM가 구조적 정보와 텍스트 정보를 모두 이해할 수 있도록 한다.
  • 주요 두 가지 패러다임을 지원한다: 판별 기반 모델(예: 링크 예측을 위해 BERT의 미세조정), 생성 기반 모델(예: T5 또는 GPT-3를 사용한 답변 생성).
  • 사용자 정의 가능한 훈련 단계, 손실 계산 및 조기 정지 기능을 갖춘 모듈식 트레이너 및 평가기 클래스를 포함하여 융통성 있는 훈련 파이프라인을 제공한다.
  • 표준 평가 지표인 hits@k(k=1,3,10) 및 평균 순위(MR)를 구현한 메트릭 클래스를 제공하며, 생성 작업에는 BLEU-1을 사용한다.
  • 레이블 스무딩, 지수 이동 평균, 상위-k 음성 샘플링, 조기 정지 등 기법을 통합한 '트릭의 가방' 모듈을 통해 훈련 안정성과 성능을 향상시킨다.
  • 플러그 가능한 엔티티 임베딩 모듈을 통해 엔티티 표현을 강화하여 지식 탐색 작업에서 사실적 기억력을 향상시킨다.

실험 결과

연구 질문

  • RQ1통합형 오픈소스 라이브러리가 다양한 PLM 기반 KGE 방법을 다수의 후행 작업에서 효과적으로 지원할 수 있는가?
  • RQ2소형 PLM(BERT, T5 등)과 대형 언어 모델(GPT-3, ChatGPT 등)은 지식 그래프 보완 작업에서 성능 면에서 어떻게 비교되는가?
  • RQ3GPT-3 및 ChatGPT와 같은 생성 기반 모델이 제로샷 지식 그래프 보완 및 질의 응답에서 판별 기반 모델보다 얼마나 뛰어나게 성능을 내는가?
  • RQ4외부 지식과 결합된 PLM 기반 KGE 통합이 지식 탐색 작업에서 사실적 기억력 향상에 기여하는가?
  • RQ5특히 1-1 대비 1-n 링크 예측 시나리오에서 관계 유형에 따라 모델 성능은 어떻게 변화하는가?

주요 결과

  • LambdaKG는 FB15k-237에서 경쟁적인 성능을 기록했으며, KGT5가 지식 그래프 보완에서 다른 모델들을 능가했다.
  • ChatGPT는 FB15k-237에서 text-davinci-003보다 뛰어난 성능을 보였으며, 특히 1-1 링크 예측에서 hits@1 점수가 높았다.
  • 1-1 관계 대비 1-n 관계 케이스에서 성능 저하가 심각하게 발생하여, 모호성과 모델의 추론 한계로 인해 다중 꼬리 예측을 처리하는 데 어려움이 있음을 시사한다.
  • ATOMIC2020 공상 지식 그래프 보완 벤치마크에서 GPT-3는 제한된 성능을 보였고, ChatGPT는 더 맥락에 부합하는 답변을 생성했지만 정확도는 떨어졌다. 수작업 평가로 확인되었다.
  • 플러그 가능한 엔티티 임베딩 모듈 통합으로 LAMA 탐색 작업에서 사실적 지식 기억력이 향상되었으며, BERT와 RoBERTa가 유의미한 성능 향상을 보였다.
  • LambdaKG는 동일한 설정에서 BERT4Rec을 능가하는 성능을 보이며, PLM 기반 영화 임베딩을 활용해 ML-20m에서 효과적인 순차적 추천을 실현했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.