Skip to main content
QUICK REVIEW

[논문 리뷰] Conditional BERT Contextual Augmentation

Xing Wu, Shangwen Lv|arXiv (Cornell University)|2018. 12. 17.
Topic Modeling참고 문헌 27인용 수 13
한 줄 요약

이 논문은 레이블 조건부 마스크 언어 모델(C-MLM)을 사용해 BERT를 미세조정하여 의미적으로 일관되고 레이블에 호환되는 문장 변형을 생성하는 새로운 데이터 증강 방법인 조건부 BERT 컨텍스트 증강을 제안한다. 이 방법은 CNN 및 RNN 분류기 모두에 적용되었을 때 여섯 개의 데이터셋에서 텍스트 분류 성능을 크게 향상시키며, 기존의 기준선을 능가하고 스타일 전이 응용을 가능하게 한다.

ABSTRACT

We propose a novel data augmentation method for labeled sentences called conditional BERT contextual augmentation. Data augmentation methods are often applied to prevent overfitting and improve generalization of deep neural network models. Recently proposed contextual augmentation augments labeled sentences by randomly replacing words with more varied substitutions predicted by language model. BERT demonstrates that a deep bidirectional language model is more powerful than either an unidirectional language model or the shallow concatenation of a forward and backward model. We retrofit BERT to conditional BERT by introducing a new conditional masked language model\footnote{The term "conditional masked language model" appeared once in original BERT paper, which indicates context-conditional, is equivalent to term "masked language model". In our paper, "conditional masked language model" indicates we apply extra label-conditional constraint to the "masked language model".} task. The well trained conditional BERT can be applied to enhance contextual augmentation. Experiments on six various different text classification tasks show that our method can be easily applied to both convolutional or recurrent neural networks classifier to obtain obvious improvement.

연구 동기 및 목표

  • 기존의 텍스트 데이터 증강 방법이 단어 교체 과정에서 레이블 호환성을 유지하지 못하는 데서 비롯되는 한계를 해결하기 위해.
  • 레이블 조건부 예측을 활용해 BERT의 깊이 있는 양방향 표현을 활용하여 컨텍스트 증강을 향상시키기 위해.
  • 구성형 신경망과 순환 신경망 분류기 모두에 적용 가능한 일반적인 목적의 데이터 증강 프레임워크를 개발하기 위해.
  • 분류를 넘어서 조건부 BERT의 잠재력을 탐색하기 위해, 특히 스타일 전이 작업에서의 가능성을 살펴보기 위해.

제안 방법

  • 문장 레이블과 문맥을 모두 고려해 단어 예측을 조건화하는 새로운 조건부 마스크 언어 모델(C-MLM) 목적함수를 사용해 BERT를 미세조정한다.
  • 입력 문장의 토큰을 무작위로 마스킹하고, 레이블 호환 가능한 대체어를 예측하도록 모델을 훈련시킨다.
  • 미세조정된 조건부 BERT 모델을 사용해 마스킹된 단어를 예측된 레이블 일관성 있는 대체어로 교체함으로써 증강된 훈련 샘플을 생성한다.
  • 증강된 데이터를 사용해 텍스트 분류 작업에서 CNN 및 RNN 분류기를 훈련시킨다.
  • 입력 레이블을 뒤집고 동일한 C-MLM 메커니즘을 사용해 반대 감성의 문장을 생성함으로써 조건부 BERT 모델을 스타일 전이에 적응시킨다.
  • 주의 기반 방법을 활용해 문장에서 스타일 관련 단어를 식별하고, 이를 마스킹 및 대체하여 감성 스타일을 전이한다.

실험 결과

연구 질문

  • RQ1딥 러닝 기반의 양방향 트랜스포머 기반 언어 모델이 레이블 호환성을 유지하는 데이터 증강을 효과적으로 생성하도록 미세조정될 수 있는가?
  • RQ2텍스트 분류 작업에서 기존의 교체 기반 및 컨텍스트 기반 증강 방법과 비교해 조건부 BERT 컨텍스트 증강의 성능은 어떠한가?
  • RQ3다양한 신경망 아키텍처(예: CNN 대 RNN) 간의 하류 분류 작업에서 조건부 BERT 모델이 얼마나 일반화되는가?
  • RQ4목표 감성 레이블에 조건을 두어 조건부 BERT 모델을 스타일 전이에 재사용할 수 있는가?
  • RQ5조건부 BERT가 표준 BERT를 능가하기 위해 최적의 미세조정 스텝 수는 얼마인가?

주요 결과

  • 조건부 BERT 컨텍스트 증강은 CNN 및 RNN 분류기 모두에 적용되었을 때 여섯 개의 다양한 텍스트 분류 데이터셋에서 분류 정확도를 크게 향상시킨다.
  • 동의어 교체(WordNet 기반), 컨텍스트 기반 증강(컨텍스트 기반), 레이블 조건부 컨텍스트 기반 증강(컨텍스트+레이블 기반)을 포함한 기준선 접근법들을 모두 능가한다.
  • 조건부 BERT는 단 1~6개의 미세조정 에포크로도 성능 향상을 달성하여 높은 효율성과 구현 용이성을 보인다.
  • 모델는 강력한 일반화 능력을 보이며, 표준 BERT를 능가하기 위해 필요한 미세조정 에포크 수는 데이터셋과 분류기의 종류에 따라 1에서 6 사이로 다양하다.
  • 조건부 BERT는 감성 구조를 뒤집는 문장을 생성함으로써 스타일 전이를 성공적으로 수행할 수 있으며, 문장의 구조와 컨텍스트를 유지한다.
  • 조건부 BERT 모델은 SST2 데이터셋의 질적 예시를 통해 의미적으로 일관되고 레이블에 호환되는 문장 변형을 생성함을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.