Skip to main content
QUICK REVIEW

[논문 리뷰] Prompting as Probing: Using Language Models for Knowledge Base Construction

Dimitrios Alivanistos, Selene Báez Santamaría|arXiv (Cornell University)|2022. 08. 23.
Topic Modeling인용 수 14
한 줄 요약

이 논문은 GPT-3를 활용해 주어진 주어-관계 삼항조합에 대해 객체 예측을 생성함으로써 지식 기반을 구축하는 프롬프팅-프로빙 프레임워크인 ProP을 소개한다. 정제된 프롬프트, 엔티티 별칭 확장, 참/거짓 검증을 조합함으로써 ProP는 ISWC 2022의 LM-KBC 챌린지에서 베이스라인 대비 36.4%p 향상된 성능을 기록하였으며, 이는 대규모 언어 모델을 이용한 고품질 지식 기반 구축에 있어 수동 프롬프트 설계와 모델 규모가 핵심 요소임을 입증한다.

ABSTRACT

Language Models (LMs) have proven to be useful in various downstream applications, such as summarisation, translation, question answering and text classification. LMs are becoming increasingly important tools in Artificial Intelligence, because of the vast quantity of information they can store. In this work, we present ProP (Prompting as Probing), which utilizes GPT-3, a large Language Model originally proposed by OpenAI in 2020, to perform the task of Knowledge Base Construction (KBC). ProP implements a multi-step approach that combines a variety of prompting techniques to achieve this. Our results show that manual prompt curation is essential, that the LM must be encouraged to give answer sets of variable lengths, in particular including empty answer sets, that true/false questions are a useful device to increase precision on suggestions generated by the LM, that the size of the LM is a crucial factor, and that a dictionary of entity aliases improves the LM score. Our evaluation study indicates that these proposed techniques can substantially enhance the quality of the final predictions: ProP won track 2 of the LM-KBC competition, outperforming the baseline by 36.4 percentage points. Our implementation is available on https://github.com/HEmile/iswc-challenge.

연구 동기 및 목표

  • 대규모 언어 모델을 이용한 지식 기반 구축을 향상시키기 위해 프롬프팅을 사실 지식 탐색을 위한 프로빙 메커니즘으로 간주하는 것.
  • 영구적인 답변 집합(빈 집합 포함)을 제로샷 환경에서 예측하는 도전 과제를 해결하는 것.
  • 프롬프트 설계, 모델 크기, 엔티티 별칭 사전과 같은 보조 구성 요소가 예측 품질에 미치는 영향을 평가하는 것.
  • 특히 모호하거나 희귀한 엔티티의 경우 문자열 매칭 기반 베이스라인을 초월해 정밀도와 재현율을 향상시키는 것.
  • 정형화된 후처리 및 검증 기법과 결합된 대규모 언어 모델이 지식 그래프를 효과적으로 보완할 수 있음을 보여주는 것.

제안 방법

  • 주어-관계 쌍이 자연어 프롬프트로 변환되어 GPT-3가 잠재적 객체 답변을 탐색하도록 유도되는 다단계 파이프라인을 활용한다.
  • 다양하고 관계별로 특화된 프롬프트를 수동으로 정제하여 구조적이고 길이가 변하는 출력(빈 집합 포함)을 유도한다.
  • 엔티티의 알려진 동의어 및 별칭을 검색하는 별칭 검색기 컴포넌트를 통해 매칭 정확도와 재현율을 향상시킨다.
  • 후보 객체에 대해 이진 질문을 제기함으로써 낮은 신뢰도 예측을 걸러내기 위해 참/거짓 검증을 적용한다.
  • 일부 예시와 구조화된 데이터 증강을 통해 다양한 관계에 걸쳐 일반화 및 강건성을 향상시킨다.
  • 후처리 과정으로 정규화, 중복 제거, 흐린 매칭을 활용한 지표와의 정렬을 통해 별칭 변형을 고려한다.

실험 결과

연구 질문

  • RQ1수동 프롬프트 정제는 대규모 언어 모델을 이용한 지식 기반 구축에서 객체 예측 품질에 어떤 영향을 미치는가?
  • RQ2빈 집합 포함 길이가 변하는 출력을 유도함으로써 개방형 예측 작업에서 성능 향상에 어느 정도 기여하는가?
  • RQ3참/거짓 검증 질문은 언어 모델이 생성한 예측의 정밀도를 얼마나 높이는가?
  • RQ4지식 기반 생성에서 언어 모델의 크기가 최종 예측 품질에 미치는 영향은 어떠한가?
  • RQ5엔티티 별칭 확장은 대규모 언어 모델을 이용한 지식 기반 구축에서 재현율과 강건성을 크게 향상시킬 수 있는가?

주요 결과

  • ProP는 LM-KBC 챌린지의 테스트 세트에서 매크로-F1 기준으로 베이스라인 대비 36.4%p 향상되어 트랙 2에서 최고 점수를 기록했다.
  • 수동 프롬프트 정제가 필수적이었으며, 자동으로 생성된 프롬프트는 상당히 낮은 성능을 보였다.
  • GPT-3가 빈 집합 포함 길이가 변하는 출력을 생성하도록 유도함으로써 작업의 개방형 예측 요구사항과 더 잘 부합되는 결과를 도출했다.
  • 참/거짓 검증은 특히 모호한 관계에 대해 잘못된 또는 환각된 예측을 걸러내어 정밀도를 높였다.
  • 언어 모델의 크기가 성능에 가장 큰 영향을 미쳤으며, GPT-3와 같은 큰 모델일수록 상당히 뛰어난 결과를 도출했다.
  • 엔티티 별칭 사전은 매칭 정확도를 향상시켰고, 몇몇 사례에서는 지표에 별칭 불일치가 있었기 때문에 ProP의 예측은 정확했으나 잘못된 것으로 간주되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.