Skip to main content
QUICK REVIEW

[논문 리뷰] BERT's output layer recognizes all hidden layers? Some Intriguing Phenomena and a simple way to boost BERT

Wei-Tsung Kao, Tsung-Han Wu|arXiv (Cornell University)|2020. 01. 25.
Topic Modeling참고 문헌 22인용 수 6
한 줄 요약

이 논문은 BERT의 출력층이 어떤 층의 은닉 표현에서도 입력 토큰을 재구성할 수 있음을 발견한다—비록 그 층들에 대해 훈련되지 않았음에도 불구하고—이로 인해 층 간에 놀라운 표현 유사성이 존재한다는 것을 드러낸다. 사전 훈련된 BERT 모델에서 층을 단순히 복제함으로써(재훈련 없이) SQuAD 2.0 및 SNLI와 같은 다운스트림 NLP 작업에서 성능을 향상시킬 수 있으며, 동일한 초모수를 사용함에도 불구하고 F1 점수 최대 1.5 포인트 및 정확도 0.6% 향상이 이루어진다.

ABSTRACT

Although Bidirectional Encoder Representations from Transformers (BERT) have achieved tremendous success in many natural language processing (NLP) tasks, it remains a black box. A variety of previous works have tried to lift the veil of BERT and understand each layer's functionality. In this paper, we found that surprisingly the output layer of BERT can reconstruct the input sentence by directly taking each layer of BERT as input, even though the output layer has never seen the input other than the final hidden layer. This fact remains true across a wide variety of BERT-based models, even when some layers are duplicated. Based on this observation, we propose a quite simple method to boost the performance of BERT. By duplicating some layers in the BERT-based models to make it deeper (no extra training required in this step), they obtain better performance in the downstream tasks after fine-tuning.

연구 동기 및 목표

  • BERT의 출력층이 중간 층의 은닉 상태에서 입력 시퀀스를 재구성할 수 있는지, 비록 그에 대해 훈련되지 않았음에도 불구하고 조사하는 것.
  • 사전 훈련된 출력 헤드를 사용해 BERT의 은닉 층 간 표현 유사성을 탐색하는 것.
  • 층 복제를 통해 깊이를 증가시켜 BERT 기반 모델을 향상시키는 간단하고 훈련이 없는 방법을 개발하고 평가하는 것.
  • 이 깊이 증강 기법이 텍스트 분류, 자연어 추론, 질의 응답과 같은 다운스트림 NLP 작업에서 성능 향상에 기여하는지 평가하는 것.
  • 층 복제가 앙상블 방법과 모델 일반화에 미치는 영향을 검토하는 것.

제안 방법

  • 사전 훈련된 BERT 출력층(MLM 헤드)을 디코더로 사용하여, 추가 훈련 없이 각 층의 은닉 표현에서 입력 토큰 시퀀스를 재구성한다.
  • 각 층의 출력을 출력층에 입력했을 때 재구성된 시퀀스의 토큰 수준 정확도를 평가한다.
  • 기존 층을 복제함으로써(예: BERT-base에서 첫 번째 세 층을 복제) 모델의 깊이를 증가시키며, 가중치를 연결하지 않는다.
  • 기본 모델과 동일한 초모수를 사용해 더 깊은 모델을 다운스트림 작업에서 미세조정함으로써 직접 성능 비교가 가능하도록 한다.
  • 다양한 복제된 층 구성을 가진 여러 모델의 출력 확률을 합산하여 앙상블 모델을 생성함으로써 성능을 향상시킨다.
  • SST-2, SNLI, SQuAD 2.0 데이터셋을 사용해 BERT-base, ALBERT-base, ALBERT-large, ALBERT-xlarge, ALBERT-xxlarge에서 실험을 수행한다.

실험 결과

연구 질문

  • RQ1BERT의 출력층은 중간 층의 은닉 표현에서 원래 입력 시퀀스를 재구성할 수 있는가, 비록 그에 대해 훈련되지 않았음에도 불구하고?
  • RQ2다른 BERT 층 간의 은닉 표현이 충분히 유사한 분포를 가지는가, 따라서 동일한 출력층에 의해 디코딩될 수 있는가?
  • RQ3사전 훈련된 BERT 모델에서 층을 복제하면 재훈련 없이도 다운스트림 성능이 향상되는가?
  • RQ4층 복제로 인한 성능 향상은 다양한 BERT 변종과 NLP 작업 전반에서 일관되게 나타나는가?
  • RQ5층 복제 기법은 SQuAD 2.0와 같이 도전적인 벤치마크에서 앙상블 모델의 성능을 향상시킬 수 있는가?

주요 결과

  • BERT의 출력층은 최종 층의 표현 외에도 모든 층의 은닉 상태에서 높은 토큰 수준 정확도로 입력 시퀀스를 재구성할 수 있다—비록 그에 대해 훈련되지 않았음에도 불구하고.
  • 이 재구성 능력은 ALBERT와 같은 여러 BERT 변종에 걸쳐 성립하며, 층 간 강력한 표현 유사성을 시사한다.
  • 사전 훈련된 BERT 모델에서 층을 복제하면 SQuAD 2.0 및 SNLI에서 일관된 성능 향상이 이루어지며, 각각 F1 점수 1.5 포인트 상승 및 SNLI에서 정확도 0.6% 향상이 이루어진다.
  • 이 성능 향상은 추가 훈련이나 초모수 조정 없이도 달성되며, 기본 모델과 동일한 설정을 사용한다.
  • 다양한 복제된 층 구성을 가진 모델을 조합한 앙상블 모델은 SQuAD 2.0에서 추가 성능 향상을 이끌어내며, 최고의 앙상블은 85.50 EM 및 88.59 F1에 도달한다.
  • SST-2에서는 성능 향상이 없었는데, 이는 작업의 단순성과 높은 기본 성능로 인해 향상 여유가 거의 없기 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.