Skip to main content
QUICK REVIEW

[논문 리뷰] DictBERT: Dictionary Description Knowledge Enhanced Language Model Pre-training via Contrastive Learning

Qianglong Chen, Feng-Lin Li|arXiv (Cornell University)|2022. 08. 01.
Topic Modeling인용 수 7
한 줄 요약

DictBERT는 대조 학습을 통해 사전 지식을 사전 학습된 언어 모델에 통합함으로써 표현 학습을 향상시킨다. 이는 두 가지 새로운 사전 학습 작업—사전 항목 예측 및 항목 설명 식별—을 도입하여 성능을 향상시킨다. 딥러닝 기반의 플러그인 지식 기반 시스템과 추가 힙 어텐션 메커니즘을 활용해, BERT-large에서 +3.3% 향상 및 GLUE에서 +0.9% 향상된 최신 기술 성과를 달성한다.

ABSTRACT

Although pre-trained language models (PLMs) have achieved state-of-the-art performance on various natural language processing (NLP) tasks, they are shown to be lacking in knowledge when dealing with knowledge driven tasks. Despite the many efforts made for injecting knowledge into PLMs, this problem remains open. To address the challenge, we propose extbf{DictBERT}, a novel approach that enhances PLMs with dictionary knowledge which is easier to acquire than knowledge graph (KG). During pre-training, we present two novel pre-training tasks to inject dictionary knowledge into PLMs via contrastive learning: extit{dictionary entry prediction} and extit{entry description discrimination}. In fine-tuning, we use the pre-trained DictBERT as a plugin knowledge base (KB) to retrieve implicit knowledge for identified entries in an input sequence, and infuse the retrieved knowledge into the input to enhance its representation via a novel extra-hop attention mechanism. We evaluate our approach on a variety of knowledge driven and language understanding tasks, including NER, relation extraction, CommonsenseQA, OpenBookQA and GLUE. Experimental results demonstrate that our model can significantly improve typical PLMs: it gains a substantial improvement of 0.5\%, 2.9\%, 9.0\%, 7.1\% and 3.3\% on BERT-large respectively, and is also effective on RoBERTa-large.

연구 동기 및 목표

  • 지식 집약적인 자연어 처리 작업에서 사전 학습된 언어 모델(PLM)의 사실 기반 지식 부족 문제를 해결하기 위해.
  • 복잡한 지식 그래프(KG) 또는 노이즈가 많은 위키백과 자료 대신 쉽게 접근 가능한 사전 지식을 사용하는 것이 타당하고 효과적인지 탐색하기 위해.
  • 사전 학습된 언어 모델의 지식 통합 능력과 일반 언어 이해 능력을 동시에 향상시키는 방법을 개발하기 위해.
  • 실제 산업 및 학술 환경에서 쉽게 구현 가능한 실용적이고 확장 가능한 접근법을 설계하기 위해.

제안 방법

  • 사전 항목 예측(항목 마스킹 및 설명으로부터 예측)과 항목 설명 식별(동의어/반의어를 양성/음성 샘플로 사용하는 대조 학습)이라는 두 가지 새로운 사전 학습 작업을 제안한다.
  • 유사한 의미를 가진(양성) 및 다소 다른 의미를 가진(음성) 설명 간의 구분을 통해 항목 표현의 강건성을 향상시키기 위해 대조 학습을 활용한다.
  • 사전 학습된 DictBERT가 피드백 훈련 중에 사전 항목 정보를 검색할 수 있도록 플러그인 지식 기반 메커니즘을 도입한다.
  • 검색된 사전 지식을 입력 표현에 효과적으로 융합하기 위해 추가 힙 어텐션 메커니즘을 활용한다.
  • 연결, LWA(학습 가능한 가중 어텐션), EHA(추가 힙 어텐션) 등의 다양한 지식 융합 전략을 지원하여 통합의灵活性를 높인다.
  • 위키백과나 지식 그래프보다 더 접근 용이하고 지식 집약적인 구조를 가진 반구조화된 사전 데이터를 활용함으로써 실용적인 구현을 가능하게 한다.

실험 결과

연구 질문

  • RQ1사전 지식, 즉 외부 지식의 한 형태로서, 지식 집약적인 작업에서 사전 학습된 언어 모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2사전 항목의 설명으로부터 유사한 의미를 가진 표현을 학습하기 위해 대조 학습이 효과적인가?
  • RQ3사전 지식으로 강화된 PLM이 지식 중심 작업뿐 아니라 일반 언어 이해 작업에서도 성능 향상을 이룰 수 있는가?
  • RQ4지식 그래프나 위키백과를 사용하는 기존 K-PLMs에 비해 DictBERT의 성능은 어떻게 비교되는가?
  • RQ5제안된 플러그인 기반의 지식 융합 메커니즘이 사전 학습된 모델을 직접 미세 조정하는 것보다 우수한 성능을 낼 수 있는가?

주요 결과

  • DictBERT는 공감적 추론 테스트, 오픈북 QA, GLUE 벤치마크에서 BERT-large에서 +3.3% 향상되며, 기존 K-PLMs를 크게 앞서는 성능을 기록한다.
  • RoBERTa-large 모델에 대해서도 GLUE 벤치마크에서 +0.9% 향상되어 특정 작업을 넘어서도 광범위하게 적용 가능함을 입증한다.
  • 절단 실험 결과, 사전 지식을 사용한 사전 학습이 필수적임을 확인하였으며, BERT-large를 플러그인으로 사용할 경우 성능 향상이 미미함을 보였다.
  • 대조 학습(항목 설명 식별)은 평균 +0.4% 향상 기여를 하여 표현 학습에서의 역할을 검증하였다.
  • 추가 힙 어텐션 메커니즘(EHA)이 가장 높은 성능을 기록하였으며, CSQA에서 BERT-large 대비 +6.1%, OBQA에서 +7.7% 향상되었다.
  • 더 큰 사전(케임브리지, 옥스포드, 위키낱개에서 확보한 100만 개 항목)을 사용할 경우 평균 +0.23% 향상되었으며, 이는 확장성과 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.