Skip to main content
QUICK REVIEW

[논문 리뷰] LIMIT-BERT : Linguistic Informed Multi-Task BERT

Junru Zhou, Zhuosheng Zhang|arXiv (Cornell University)|2019. 10. 31.
Topic Modeling참고 문헌 57인용 수 14
한 줄 요약

LIMIT-BERT는 문맥적으로 정보화된 다중 작업 BERT 모델로, 부분 품사 태깅, 구성 요소 및 의존성 파싱, 스파ن 및 의존성 SRL을 포함한 다섯 가지 언어학적 작업을 함께 사전 훈련하며, 준지도 학습 전략과 향상된 마스킹 언어 모델링 목적함수를 사용한다. 이 모델은 문법적 및 의미적 구조를 사전 훈련 중에 활용하여, 문법적 파싱, GLUE 및 SNLI 벤치마크에서 최신 기술 수준의 성능을 달성한다. Whole Word Masking BERT를 능가한다.

ABSTRACT

In this paper, we present a Linguistic Informed Multi-Task BERT (LIMIT-BERT) for learning language representations across multiple linguistic tasks by Multi-Task Learning (MTL). LIMIT-BERT includes five key linguistic syntax and semantics tasks: Part-Of-Speech (POS) tags, constituent and dependency syntactic parsing, span and dependency semantic role labeling (SRL). Besides, LIMIT-BERT adopts linguistics mask strategy: Syntactic and Semantic Phrase Masking which mask all of the tokens corresponding to a syntactic/semantic phrase. Different from recent Multi-Task Deep Neural Networks (MT-DNN) (Liu et al., 2019), our LIMIT-BERT is linguistically motivated and learning in a semi-supervised method which provides large amounts of linguistic-task data as same as BERT learning corpus. As a result, LIMIT-BERT not only improves linguistic tasks performance but also benefits from a regularization effect and linguistic information that leads to more general representations to help adapt to new tasks and domains. LIMIT-BERT obtains new state-of-the-art or competitive results on both span and dependency semantic parsing on Propbank benchmarks and both dependency and constituent syntactic parsing on Penn Treebank.

연구 동기 및 목표

  • 다양한 문법적 및 의미적 작업에서의 명시적 언어학 지식을 통합함으로써 사전 훈련된 언어 표현을 향상시키는 것.
  • 대규모 비라벨 텍스트와 소규모 골드 표준 언어학 데이터셋 간의 데이터 불균형 문제를 준지도 학습을 통해 해결하는 것.
  • 사전 훈련 중에 알려진 문법적 및 의미적 구성요소를 통합하여 마스킹 언어 모델링 목적함수를 향상시키는 것.
  • 언어학적 작업의 공동 학습이 후속 자연어 이해(NLU) 작업을 위한 더 일반화 가능하고 강력한 표현을 이끌어내는지 입증하는 것.
  • 다양한 자연어 처리 응용 분야에서 효과적인 다목적 사전 훈련 모델을 공개하는 것.

제안 방법

  • 부분 품사 태깅, 구성 요소 및 의존성 파싱, 스팬 및 의존성 SRL을 포함한 다섯 가지 언어학적 작업을 통합된 다중 작업 학습 프레임워크에 통합한다.
  • 준지도 학습 전략을 적용: 대규모 비라벨 텍스트에 대해 사전 훈련된 모델을 사용해 언어학적 태깅을 예측하고, 이러한 가짜 레이블을 골드 표준 데이터셋과 결합한다.
  • 기존의 BERT 마스킹 언어 모델링 목적함수를 개선하여, 알려진 문법적 및 의미적 구성요소를 조건으로 마스킹 예측을 수행함으로써 문맥 표현 학습을 향상시킨다.
  • 개별 작업 손실의 합을 사용하는 다중 작업 손실 함수를 사용하여 다양한 언어 신호에 대해 종단 간(end-to-end) 훈련을 가능하게 한다.
  • 각 언어학적 작업에 대해 작업 전용 헤드를 갖춘 공유 트랜스포머 인코더를 사용하여 파rameter 공유 및 표현 전이를 가능하게 한다.
  • 이전 모델들(예: Zhou 등, 2020)의 뛰어난 성능을 활용해 비라벨 데이터에 대해 고품질의 가짜 레이블을 생성함으로써 신뢰할 수 있는 준지도 신호를 확보한다.

실험 결과

연구 질문

  • RQ1문법과 의미의 공동 다중 작업 학습이 표준 마스킹 언어 모델링을 초월해 사전 훈련된 언어 표현을 향상시킬 수 있는가?
  • RQ2마스킹 훈련 목적함수에 언어학적 구조를 통합할 경우 후속 자연어 처리 성능에 어떤 영향을 미치는가?
  • RQ3준지도 학습을 통한 데이터 확장 전략이 사전 훈련 데이터와 언어학적 작업 데이터셋 간의 데이터 불균형 문제를 어느 정도 완화하는가?
  • RQ4여러 언어학적 작업을 동시에 학습할 경우 도메인 외부 및 제로샷 NLU 작업에서 더 나은 일반화 성능를 달성할 수 있는가?
  • RQ5통합된 모델이 스팬 기반 및 의존성 기반의 문법적 및 의미적 태깅을 효과적으로 처리할 수 있는가?

주요 결과

  • LIMIT-BERT는 CoNLL-2005, CoNLL-2009 및 Penn Treebank 트리뱅크에서 의존성 파싱 및 구성 요소 파싱 모두에서 Whole Word Masking BERT를 능가한다.
  • GLUE 벤치마크에서 최신 기술 수준의 성능을 달성하여 다양한 NLU 작업으로의 일반화 능력 향상을 입증한다.
  • SNLI 자연어 추론 벤치마크에서 뛰어난 성능을 기록하여 언어학적 지도를 통한 추론 능력 향상을 시사한다.
  • 준지도 훈련 전략은 고신뢰도 가짜 레이블을 사용해 훈련 데이터를 확장함으로써 자원이 적은 언어학적 작업에서 성능 향상을 크게 개선한다.
  • 문법적 및 의미적 구성요소에 기반한 향상된 마스킹 훈련 목적함수는 더 견고하고 정보가 풍부한 표현을 이끌어낸다.
  • 공개된 LIMIT-BERT 모델은 다양한 자연어 처리 응용 분야에서 효과적인 다목적 사전 훈련 모델로 활용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.