[논문 리뷰] LLM2KB: Constructing Knowledge Bases using instruction tuned context aware Large Language Models
이 논문은 LoRA를 사용한 파rameter 효율적인 미세조정을 통해 지침에 맞춘 컨텍스트 인식 대규모 언어 모델(Llama-2-13b-chat 및 StableBeluga-13B)을 사용하여 지식 기반을 구축하는 LLM2KB 시스템을 제시한다. 밀도 있는 파스제 검색(DPR)을 통해 확보한 위키백과 페이지 컨텍스트를 활용하여, LM-KBC 2023 챌린지의 21개 관계에서 평균 F1 스코어 0.6185를 달성하며, 최소한의 파라미터 업데이트로 효과적인 지식 기반 구축을 입증한다.
The advent of Large Language Models (LLM) has revolutionized the field of natural language processing, enabling significant progress in various applications. One key area of interest is the construction of Knowledge Bases (KB) using these powerful models. Knowledge bases serve as repositories of structured information, facilitating information retrieval and inference tasks. Our paper proposes LLM2KB, a system for constructing knowledge bases using large language models, with a focus on the Llama 2 architecture and the Wikipedia dataset. We perform parameter efficient instruction tuning for Llama-2-13b-chat and StableBeluga-13B by training small injection models that have only 0.05 % of the parameters of the base models using the Low Rank Adaptation (LoRA) technique. These injection models have been trained with prompts that are engineered to utilize Wikipedia page contexts of subject entities fetched using a Dense Passage Retrieval (DPR) algorithm, to answer relevant object entities for a given subject entity and relation. Our best performing model achieved an average F1 score of 0.6185 across 21 relations in the LM-KBC challenge held at the ISWC 2023 conference.
연구 동기 및 목표
- 대규모 언어 모델을 사용하여 효율적이고 확장 가능한 지식 기반 구축 방법을 개발하기 위해.
- 대규모 모델의 미세조정에 높은 계산 비용이 수반되므로, LoRA와 같은 파rameter 효율적인 기법을 활용하여 이를 해결하기 위해.
- 밀도 있는 파스제 검색(DPR)을 통한 컨텍스트 인식 검색을 통합하여 위키백과에서 사실 기반 지식 추출을 향상시키기 위해.
- 지침에 맞춘 대규모 언어 모델의 오픈 도메인 지식 기반 구축 성능을 평가하기 위해, 특히 사실 기억이 필요한 관계에 중점을 두어.
- 학습 데이터 생성 전략과 모델 아키텍처가 관계 추출 성능에 미치는 영향을 조사하기 위해.
제안 방법
- LoRA를 사용하여 Llama-2-13b-chat 및 StableBeluga-13B를 미세조정하여 기초 모델 파라미터의 0.05%만 업데이트한다.
- 밀도 있는 파스제 검색(DPR)을 통해 검색된 주제 엔티티에 대한 위키백과 페이지 컨텍스트를 통합한 프롬프트 엔지니어링 전략을 사용하여 학습 샘플을 생성한다.
- 컨텍스트 인식 인라인 학습을 활용하여 LLM이 주어진 주제와 관계에 대해 목적 엔티티를 예측하도록 지시하는 프롬프트를 설계한다.
- 학습 샘플 생성을 위한 두 가지 데이터 생성 방법을 사용: 하나는 훈련 세트만 사용하고, 다른 하나는 훈련 세트와 검증 세트를 모두 사용한다.
- LM-KBC 2023 챌린지의 테스트 세트에서 매크로 평균 정밀도, 재현율, F1 스코어를 사용하여 모델 성능을 평가한다.
- 예측된 목적 엔티티를 확인하기 위해 Wikidata API를 사용하여 환상적 또는 존재하지 않는 엔티티를 걸러낸다.

실험 결과
연구 질문
- RQ1LoRA를 사용한 파rameter 효율적인 미세조정이 전체 미세조정 없이도 대규모 언어 모델을 지식 기반 구축에 효과적으로 적응시킬 수 있는가?
- RQ2DPR를 통해 검색된 위키백과 파스제에서의 컨텍스트 통합이 관계 예측의 사실적 정확도에 어떤 영향을 미치는가?
- RQ3지시에 맞춘 Llama-2-13b-chat과 StableBeluga-13B 간의 오픈 도메인 지식 기반 구축 작업에서의 성능 차이는 무엇인가?
- RQ4다른 데이터 생성 전략(훈련 세트만 vs. 훈련 및 검증 세트)이 모델 일반화 및 F1 스코어에 어떤 영향을 미치는가?
- RQ5'PersonHasNumberOfChildren' 및 'SeriesHasNumberOfEpisodes'와 같은 특정 관계는 컨텍스트 주입에도 불구하고 낮은 성능을 보이는 이유는 무엇인가?
주요 결과
- 가장 높은 성능을 보인 모델은 메서드 1 데이터 생성 방식을 사용한 Llama-2-13b-chat이며, LM-KBC 2023 챌린지의 21개 관계에서 평균 F1 스코어 0.6185를 달성했다.
- 동일한 데이터 생성 방법을 사용했을 때 Llama-2-13b-chat 모델이 StableBeluga-13B 모델보다 성능이 뛰어나, 아키텍처나 미세조정 감도에 기인한 것으로 나타났다.
- 'PersonHasNoblePrize' 관계는 가장 높은 F1 스코어(0.9567)를 기록했고, 반면 'PersonHasEmployer' 관계는 가장 낮은 F1 스코어(0.2555)를 기록하여 모델이 특정 관계에 강한 편향을 보이고 있음을 시사한다.
- 'PersonHasNumberOfChildren' 및 'SeriesHasNumberOfEpisodes'와 같은 수치형 답변이 필요한 관계는 낮은 성능(F1 < 0.5)을 보였으며, 이는 모델이 종종 컨텍스트 부족이나 암기된 사실에 의존하기 때문이다.
- 모델은 환상적 문제를 보였으며, 존재하지 않는 목적 엔티티를 유사하게 보이게 생성했고, 이는 Wikidata API로 확인되지 않았다.
- 추론 중 간단한 프롬프트 변형만으로도 성능이 크게 떨어지는 것으로 나타나, 프롬프트 엔지니어링의 취약성을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.