Skip to main content
QUICK REVIEW

[논문 리뷰] Expanding the Vocabulary of BERT for Knowledge Base Construction

Dong Yang, Xu Wang|arXiv (Cornell University)|2023. 10. 12.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 토큰 재코딩과 과제별 재미니피티를 통해 의미적 임베딩을 유지하면서 다중 토큰 엔티티를 BERT의 어휘에 확장하는 방법인 Vocabulary Expandable BERT(VE-BERT)를 제안한다. 이 방법은 단지 130M 파라미터를 가진 BERT-base 모델을 사용하여 검증 세트에서 F1 점수 0.362, 숨겨진 테스트 세트에서 0.323을 기록하며, 동일한 제약 조건 하에서 GPT-3(175B 파라미터)를 능가하는 성능을 달성한다.

ABSTRACT

Knowledge base construction entails acquiring structured information to create a knowledge base of factual and relational data, facilitating question answering, information retrieval, and semantic understanding. The challenge called "Knowledge Base Construction from Pretrained Language Models" at International Semantic Web Conference 2023 defines tasks focused on constructing knowledge base using language model. Our focus was on Track 1 of the challenge, where the parameters are constrained to a maximum of 1 billion, and the inclusion of entity descriptions within the prompt is prohibited. Although the masked language model offers sufficient flexibility to extend its vocabulary, it is not inherently designed for multi-token prediction. To address this, we present Vocabulary Expandable BERT for knowledge base construction, which expand the language model's vocabulary while preserving semantic embeddings for newly added words. We adopt task-specific re-pre-training on masked language model to further enhance the language model. Through experimentation, the results show the effectiveness of our approaches. Our framework achieves F1 score of 0.323 on the hidden test set and 0.362 on the validation set, both data set is provided by the challenge. Notably, our framework adopts a lightweight language model (BERT-base, 0.13 billion parameters) and surpasses the model using prompts directly on large language model (Chatgpt-3, 175 billion parameters). Besides, Token-Recode achieves comparable performances as Re-pretrain. This research advances language understanding models by enabling the direct embedding of multi-token entities, signifying a substantial step forward in link prediction task in knowledge graph and metadata completion in data management.

연구 동기 및 목표

  • 마스크된 언어 모델을 사용한 지식 기반 구축에서 다중 토큰 엔티티를 예측하는 과제를 해결한다.
  • 표준 BERT의 고정된 어휘로 인해 다중 토큰 엔티티 예측에 한계가 있음을 극복한다.
  • 랜덤 초기화에 의존하지 않고도 새로 추가된 다중 토큰 엔티티의 효과적인 의미적 표현을 가능하게 한다.
  • 경량이며 파라미터 제약 조건이 있는 언어 모델을 사용하여 링크 예측 및 지식 그래프 보완을 향상시킨다.
  • 과제별 재미니피티 및 토큰 재코딩 기법이 LM-KBC 2023 과제에서 성능 향상에 크게 기여한다는 것을 입증한다.

제안 방법

  • 다중 토큰 엔티티를 어휘 내 단일 토큰으로 통합하기 위해 BERT의 입력 및 출력 임베딩 레이어를 수정한다.
  • 구성 토큰 표현을 활용하여 새로운 다중 토큰 엔티티의 의미적 임베딩을 생성하는 토큰 재코딩(TR) 방법을 도입한다.
  • 도전 과제에서 정의된 술어를 사용하여 WikiData를 쿼리하여 고유한 엔티티 어휘를 구축한다.
  • 어휘에서 고빈도 엔티티를 포함한 필터링된 위키백과 문장을 대상으로 과제별 재미니피티를 수행한다.
  • LM-KBC 2023 과제의 훈련 세트에서 모델을 미세조정하여 종단 간 지식 기반 구축을 수행한다.
  • 검증 세트에서 관계 유형별 예측 성능을 최적화하기 위해 임계값 기반 엔티티 분류 전략을 사용한다.

실험 결과

연구 질문

  • RQ11B 파라미터 제약 조건 하에서 경량 BERT 모델이 지식 기반 구축에서 다중 토큰 엔티티를 효과적으로 예측할 수 있는가?
  • RQ2토큰 재코딩 방법이 랜덤 초기화보다 새로 추가된 다중 토큰 엔티티에 대해 더 나은 초기 의미적 임베딩을 제공하는가?
  • RQ3위키백과 문장에 대한 과제별 재미니피티가 지식 기반 구축 성능을 얼마나 향상시키는가?
  • RQ4토큰 재코딩과 재미니피티의 조합이 개별 방법에 비해 F1 점수 향상에서 어떤가?
  • RQ5VE-BERT는 훨씬 적은 파라미터를 가졌음에도 불구하고 GPT-3와 같은 대규모 언어 모델을 능가하는 이유는 무엇인가?

주요 결과

  • VE-BERT는 검증 세트에서 F1 점수 0.362, 숨겨진 테스트 세트에서 0.323를 기록하며, 동일한 제약 조건 하에서 GPT-3(175B 파라미터)의 성능을 초월했다.
  • 토큰 재코딩 방법은 추가 학습이 필요 없이 재미니피티와 유사한 성능을 달성하여, 고품질 임베딩을 초기화하는 데 효과적임을 입증했다.
  • 위키백과 문장에 대한 재미니피티로 지식 기반 구축 성능이 약 2%p 향상되었다.
  • 토큰 재코딩과 재미니피티의 병합 사용은 약 5%p의 향상 효과를 보였으며, 개별 성능 향상의 합을 초월하여 상호보완적 이점이 있음을 시사했다.
  • VE-BERT는 'CompoundHasParts' 및 'CountryHasOfficialLanguage'와 같은 일반 지식 술어에서는 뛰어난 성능을 보였지만, 'PersonHasSpouse'와 같은 이름 기반 술어에서는 어휘 내 빈도가 낮아 성능이 저하되었다.
  • 모델의 성능은 훈련 어휘 내에서 이름 엔티티의 발생 빈도가 낮기 때문에 제한을 받았으며, 이는 희귀 엔티티 유형의 더 나은 커버리지 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.