Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Enhanced Contextual Word Representations

Matthew E. Peters, Mark E Neumann|arXiv (Cornell University)|2019. 09. 09.
Topic Modeling참고 문헌 66인용 수 12
한 줄 요약

이 논문은 지식 주의 및 재정의화(KAR) 메커니즘을 사용하여 WordNet과 위키백과와 같은 다양한 지식기반(KB)에서 구조화된 지식을 통합함으로써 BERT의 문맥적 단어 표현을 향상시키는 KnowBert를 제안한다. 레이블이 없는 텍스트에서 엔티티 링킹기와 언어 모델을 공동으로 훈련시킴으로써 KnowBert는 사실적 기억력 향상, 퍼플렉서티 감소, 관계 추출, 엔티티 타이핑, 단어의 의미 해석과 같은 다운스트림 작업에서 최신 기술 수준의 성능을 달성하며, 여러 벤치마크에서 BERT$_{\text{LARGE}}$를 능가한다.

ABSTRACT

Contextual word representations, typically trained on unstructured, unlabeled text, do not contain any explicit grounding to real world entities and are often unable to remember facts about those entities. We propose a general method to embed multiple knowledge bases (KBs) into large scale models, and thereby enhance their representations with structured, human-curated knowledge. For each KB, we first use an integrated entity linker to retrieve relevant entity embeddings, then update contextual word representations via a form of word-to-entity attention. In contrast to previous approaches, the entity linkers and self-supervised language modeling objective are jointly trained end-to-end in a multitask setting that combines a small amount of entity linking supervision with a large amount of raw text. After integrating WordNet and a subset of Wikipedia into BERT, the knowledge enhanced BERT (KnowBert) demonstrates improved perplexity, ability to recall facts as measured in a probing task and downstream performance on relationship extraction, entity typing, and word sense disambiguation. KnowBert's runtime is comparable to BERT's and it scales to large KBs.

연구 동기 및 목표

  • 실세계의 엔티티에서 온 사실 지식을 유지하는 데에 실패하는 문맥적 단어 표현의 한계를 해결하기 위해.
  • 작업에 특화된 미세조정 없이도 다양한 지식기반을 대규모 사전 훈련된 언어 모델에 통합할 수 있는 일반적이고 확장 가능한 방법을 개발하기 위해.
  • 구조화된 지식에 기반한 문맥 표현을 정착시킴으로써 마스크된 언어 모델링 퍼플렉서티와 사실적 기억력을 향상시키기 위해.
  • 관계 추출 및 단어의 의미 해석과 같은 사실 추론이 필요한 다운스트림 NLP 작업에서 최신 기술 수준의 성능을 달성하기 위해.
  • 지식 주입을 경량 모듈로 삽입함으로써 기존 BERT 기반 시스템과의 계산 효율성과 호환성을 유지하기 위해.

제안 방법

  • BERT의 두 레이어 사이에 삽입되는 지식 주의 및 재정의화(KAR) 모듈을 도입하여 외부 KB에서 지식을 통합한다.
  • 통합된 엔티티 링킹기로 입력 텍스트의 스팬에서 KB(예: WordNet, 위키백과)에서 엔티티 임베딩을 검색한다.
  • 검색된 엔티티 임베딩을 사용하여 단어에서 엔티티로의 주의를 적용함으로써 문맥적 단어 표현을 재정의하고, 장거리 상호작용을 가능하게 한다.
  • 레이블이 없는 텍스트에서 자기지도 학습 언어 모델링과 소량의 엔티티 링킹 감독을 조합한 다중임무 목적함수를 사용하여 엔티티 링킹기와 언어 모델을 공동으로 사전 훈련한다.
  • 관계 추출에서 주어와 목적어 스팬을 표시하기 위해 특수 토큰 [E1], [/E1], [E2], [/E2]를 사용하고, 엔티티 타이핑에는 [E], [/E]를 사용한다.
  • 엔티티 임베딩을 위해 TuckER를 사용하고, 최소한의 구조적 요구 조건을 통해 다양한 KB 형식과의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1여러 개의 KB에서 구조화된 지식을 통합하면 사전 훈련된 모델의 사실적 기억력과 문맥적 단어 표현의 질이 향상되는가?
  • RQ2레이블이 없는 텍스트에서 엔티티 링킹과 언어 모델링을 엔드 투 엔드로 공동 훈련하면 일반화 능력과 사실 지식 통합이 향상되는가?
  • RQ3BERT에 지식을 경량 모듈로 삽입함으로써 추론 속도를 희생시키지 않고도 다운스트림 NLP 작업 성능 향상이 가능한가?
  • RQ4내재적 및 외재적 평가에서 증강된 지식이 있는 모델의 성능이 BERT$_{\text{LARGE}}$와 기타 지식 증강 모델과 비교해 어떻게 되는가?
  • RQ5이 방법은 대규모 KB에 대해 얼마나 확장 가능하며, ConceptNet이나 도메인 전용 KB와 같은 다양한 지식 소스를 지원할 수 있는가?

주요 결과

  • KnowBert-W+W는 WiC 데이터셋에서 테스트 F1 스코어 76.1을 기록하여 BERT$_{\text{LARGE}}$를 1.4% 뛰어넘고 인간 성능과의 격차를 13.3% 줄였다.
  • TACRED 관계 추출에서 KnowBert-W+W는 F1 70.9%를 기록하여 BERT$_{\text{LARGE}}$를 1.4% 뛰어나고 ERNIE를 3.5% 뛰어넘었다.
  • 엔티티 타이핑에서 KnowBert-W+W는 F1 76.1을 기록하여 ERNIE보다 0.6% 향상되었고, BERT$_{\text{BASE}}$보다 2.5% 향상되었다.
  • KnowBert는 BERT$_{\text{BASE}}$보다 마스크된 언어 모델링 퍼플렉서티를 감소시켜 지식 통합 후 언어 모델링 품질 향상을 입증했다.
  • 더 작은 BERT$_{\text{BASE}}$ 아키텍처를 사용함에도 불구하고 KnowBert-W+W는 사실적 기억력과 내재적 탐색 작업에서 BERT$_{\text{LARGE}}$를 능가했다.
  • KAR 모듈은 최소한의 계산 오버헤드를 유발하여 BERT와 유사한 런타임을 유지하며, 다운스트림 응용에서 BERT를 KnowBert로 간편하게 교체할 수 있도록 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.