Skip to main content
QUICK REVIEW

[논문 리뷰] Infusing Knowledge into Large Language Models with Contextual Prompts

Kinshuk Vasisht, Balaji Ganesan|arXiv (Cornell University)|2024. 03. 03.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 구조화된 지식 그래프에 의존하지 않고 도메인 특화 코퍼스에서 문맥적 프롬프트를 생성함으로써 대규모 언어 모델(Large Language Models, LLMs)에 지식을 통합하는 방법을 제안한다. 입력 프롬프트에 실체 기반 검색을 통해 검색된 관련 문장들을 보강하여 미세조정한 LLM은 뚜렷한 성능 향상을 보이며, 예를 들어 TACRED에서 Hits@1이 0.827, KELM-TEKGEN에서 0.805에 이를 정도로 효과적인 지식 통합을 달성한다. 이는 자원이 적거나 표현이 부족한 실체에 대해서도 성공적인 지식 통합을 가능하게 한다.

ABSTRACT

Knowledge infusion is a promising method for enhancing Large Language Models for domain-specific NLP tasks rather than pre-training models over large data from scratch. These augmented LLMs typically depend on additional pre-training or knowledge prompts from an existing knowledge graph, which is impractical in many applications. In contrast, knowledge infusion directly from relevant documents is more generalisable and alleviates the need for structured knowledge graphs while also being useful for entities that are usually not found in any knowledge graph. With this motivation, we propose a simple yet generalisable approach for knowledge infusion by generating prompts from the context in the input text. Our experiments show the effectiveness of our approach which we evaluate by probing the fine-tuned LLMs.

연구 동기 및 목표

  • 실제 자연어 처리(NLP) 응용에서 도메인 특화 또는 자원이 적은 실체를 위한 구조화된 지식 그래프를 유지하는 것이 비현실적이라는 문제를 해결하기 위해.
  • 사전에 존재하는 지식 기반 또는 실체 임베딩에 의존하는 기존 지식 통합 기법의 한계를 극복하기 위해.
  • 지식 그래프에 잘 표현되지 않은 희귀하거나 도메인 특화된 개별 실체에 대해서도 효과적인 지식 통합을 가능하게 하기 위해.
  • 구조화되지 않은 텍스트 코퍼스와 미세조정만을 사용하여도 확장 가능하고 일반화 가능하며 효율적인 지식 통합 방법을 개발하기 위해.
  • 문맥 길이와 품질이 관계 예측 및 개방형 도메인 질문 응답과 같은 지식 집약적인 NLP 작업에 미치는 영향을 평가하기 위해.

제안 방법

  • 입력 프롬프트에 언급된 실체를 바탕으로 검색 인덱스를 사용해 도메인 특화 코퍼스에서 관련 문장들을 검색한다.
  • 관련 실체를 기술하는 검색된 문장을 입력 프롬프트에 보강하여 문맥적 프롬프트를 생성한다.
  • 검색된 문맥에서 유래한 지식을 통합하기 위해 사전에 훈련된 LLM(예: Flan-T5)을 보강된 프롬프트로 미세조정한다.
  • 구조화된 지식 그래프가 가용할 경우 실체 연결 및 의미 해소를 통해 문맥 검색 정확도를 향상시킨다.
  • 표현형 데이터 및 그래프와 같은 다른 모odalities로도 이 방법을 확장하여 더 넓은 적용 가능성을 확보한다.
  • 표준 평가 지표를 사용하여 관계 예측 및 개방형 도메인 질문 응답과 같은 지식 집약적 작업에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1구조화된 지식 그래프에 의존하지 않고 비구조화된 도메인 코퍼스에서 유도된 문맥적 프롬프트가 LLM에 지식을 효과적으로 통합할 수 있는가?
  • RQ2검색된 문맥의 길이와 품질은 지식 통합 LLM의 최종 작업 성능에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 사실 삼중항이나 소프트 프롬프트를 사용하는 기존 지식 통합 기법보다 우월한가?
  • RQ4이 방법은 지식 기반에 존재하지 않는 저자원 또는 표현이 부족한 실체로도 일반화 가능한가?
  • RQ5지식 그래프가 희박하거나 불완전한 실세계 도메인, 예를 들어 법적 텍스트와 같은 분야에서 이 방법은 얼마나 효과적인가?

주요 결과

  • 문맥적 프롬프트로 미세조정한 결과, TACRED 데이터셋에서 Hits@1이 0.827에 도달하여 기본 모델의 0.050에 비해 뚜렷한 향상을 보였다.
  • KELM-TEKGEN 데이터셋에서는 문맥적 프롬프트를 사용한 모델이 Hits@1이 0.805에 도달했으며, 기본 미세조정 모델의 0.056에 비해 뛰어난 성능을 보였다.
  • 문맥 길이를 늘릴수록 성능 향상이 있었으며, TACRED에서 문맥 길이를 늘여 Hits@1이 0.846에서 0.914로 상승함으로써, 더 나은 문맥 품질이 지식 접근성을 향상시킨다는 것을 시사했다.
  • 문맥적 프롬프트를 사용한 결과, TriviaQA 질문 응답 작업에서 정확도 정합도(Exact Match)가 20.0%에 도달했으며, 기본 모델(16.7%)과 단순 미세조정 모델(20.0%)보다 뛰어난 성능을 보였다.
  • 법적 도메인 환경에서는 Hits@10가 0.245에서 0.290로, MRR가 0.200에서 0.217로 향상되어 자원이 적고 지식이 희박한 환경에서도 효과적임을 입증했다.
  • 지식 그래프가 불완전하거나 가용하지 않은 상황에서도 이 방법이 강건함을 입증했으며, Wikidata나 유사 저장소에 존재하지 않는 실체에 대해서도 효과적으로 작동함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.