Skip to main content
QUICK REVIEW

[논문 리뷰] BertNet: Harvesting Knowledge Graphs with Arbitrary Relations from Pretrained Language Models

Shibo Hao, Bowen Tan|arXiv (Cornell University)|2022. 06. 28.
Topic Modeling인용 수 13
한 줄 요약

BertNet는 사전에 정의된 관계에 국한되지 않고, 최소한의 사용자 입력(관계 프롬프트와 몇 개의 few-shot 예시)만으로도 사전 학습된 언어 모델(LM)에서 임의의 관계를 가진 대규모 상징적 지식 그래프(KG)를 자동으로 추출하는 프레임워크이다. 검색 및 재순서 전략과 프롬프트 가중치 기법을 결합하여, BERT, RoBERTa, DistilBERT 등의 모델에서 400개 이상의 새로운 관계를 포함해 다양한 복잡한 관계(예: '할 수는 있지만 잘하지는 못함')를 높은 정확도로 추출한다.

ABSTRACT

It is crucial to automatically construct knowledge graphs (KGs) of diverse new relations to support knowledge discovery and broad applications. Previous KG construction methods, based on either crowdsourcing or text mining, are often limited to a small predefined set of relations due to manual cost or restrictions in text corpus. Recent research proposed to use pretrained language models (LMs) as implicit knowledge bases that accept knowledge queries with prompts. Yet, the implicit knowledge lacks many desirable properties of a full-scale symbolic KG, such as easy access, navigation, editing, and quality assurance. In this paper, we propose a new approach of harvesting massive KGs of arbitrary relations from pretrained LMs. With minimal input of a relation definition (a prompt and a few shot of example entity pairs), the approach efficiently searches in the vast entity pair space to extract diverse accurate knowledge of the desired relation. We develop an effective search-and-rescore mechanism for improved efficiency and accuracy. We deploy the approach to harvest KGs of over 400 new relations from different LMs. Extensive human and automatic evaluations show our approach manages to extract diverse accurate knowledge, including tuples of complex relations (e.g., "A is capable of but not good at B"). The resulting KGs as a symbolic interpretation of the source LMs also reveal new insights into the LMs' knowledge capacities.

연구 동기 및 목표

  • 기존 지식 그래프 구축 방법이 사전에 정의된 수동으로 코딩된 관계에 국한되어 있다는 한계를 해결하기 위해.
  • 기존 코퍼스나 KG에 포함되지 않은 새로운 관계에 대해서도 사전 학습된 언어 모델에서 상징적이고 구조화된 지식을 자동으로 추출할 수 있도록 하기 위해.
  • 암묵적인 LM 지식을 명시적이고 탐색 가능하며 약간의 편집이 가능한 상징적 KG로 변환하는 효율적이고 정확한 방법을 개발하기 위해.
  • 다양한 LMs와 관계(복잡한 관계나 다중 인자 관계 포함)를 대상으로 방법을 평가하여 LMs의 지식 용량을 이해하기 위해.

제안 방법

  • 프레임워크는 자연어 프롬프트(예: 'X는 Y를 할 수 있지만 잘하지는 못함')와 몇 개의 few-shot 예시로 구성된 관계 정의를 입력으로 받는다.
  • 주어진 헤드 엔티티와 관계에 대해 LM의 자동회귀 생성 기능을 활용하여 꼬리 엔티티를 예측하는 방식으로, 괴상한 엔티티 쌍의 거대한 공간을 탐색하는 검색 전략을 수행한다.
  • 효율성과 정확도를 향상시키기 위해 검색 및 재순서 메커니즘을 도입한다: 프롬프트 가능성과 신뢰도를 기반으로 학습된 스코링 함수를 사용해 후보 튜플을 순위 매긴다.
  • 재순서 기반 프롬프트 가중치 전략을 도입하여 프롬프트 다의어화 기법을 향상시켜 다양한 프롬프트 간의 강건성과 일관성을 높인다.
  • BERT, RoBERTa, DistilBERT 등 다양한 LMs를 지원하며, 기반 LM의 지식을 상징적 해석으로서의 전체 KG를 생성한다.
  • 자동 및 인간 평가 프로토콜을 포함하여 추출된 지식의 품질과 다양성을 검증한다.

실험 결과

연구 질문

  • RQ1기존 KG(예: ConceptNet)에 존재하지 않는 새로운 관계를 가진 고품질의 다양성 있는 지식 그래프를 사전 학습된 언어 모델에서 추출할 수 있는가?
  • RQ2거대한 엔티티 쌍 공간을 탐색할 때 검색 및 재순서 메커니즘이 효율성과 정확도 사이를 얼마나 잘 균형 잡고 있는가?
  • RQ3다양한 LMs(BERT, RoBERTa, DistilBERT 등)가 복잡하거나 다중 인자 관계를 얼마나 잘 인코딩하고 추출할 수 있는가?
  • RQ4모델 크기와 사전 학습 전략이 추출된 지식의 품질에 영향을 미치는가? 지식 증류(Knowledge distillation)는 지식 유지에 도움이 되는가?
  • RQ5결과로 도출된 KG는 LM 내부 지식의 상징적 해석으로서 기능할 수 있으며, 이를 통해 LM의 지식 용량을 이해할 수 있는가?

주요 결과

  • BertNet는 기존 KG인 ConceptNet에 존재하지 않는 400개 이상의 새로운 관계에 대해 지식을 성공적으로 추출하여 가용한 구조화된 지식의 범위를 크게 확장했다.
  • 복잡한 관계인 'A는 B를 할 수 있지만 잘하지는 못함'과 같은 관계를 높은 정확도로 추출하여 미묘한 의미적 관계를 포착할 수 있음을 입증했다.
  • 더 큰 LMs(RoBERTa-large, BERT-large 등)는 기본 모델 대비 약 3–7% 높은 정확도를 보이며, 모델 규모가 지식 인코딩 능력을 향상시킨다는 것을 시사한다.
  • 더 나은 사전 학습 전략(RoBERTa vs. BERT)은 더 나은 지식 품질을 이끌어내며, RoBERTaNet-large는 BertNet-large보다 정확도에서 3%p 높은 성능을 보였다.
  • 지식 증류(예: DistilBERT)는 지식 유지에 기여하여, 지도 모델(BERT-base) 대비 정확도를 약 4% 향상시켰으며, 노이즈 감소가 주요 원인으로 보인다.
  • ConceptNet 및 LAMA 벤치마크에서 COMET과 LPAQA와 같은 베이스라인에 비해 프레임워크가 우수한 성능을 보였으며, 특히 꼬리 엔티티 예측을 넘어서 전체 튜플을 평가하는 데서 두드러진 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.