Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluation of BERT and ALBERT Sentence Embedding Performance on Downstream NLP Tasks

Hyun‐Jin Choi, Judong Kim|arXiv (Cornell University)|2021. 01. 26.
Topic Modeling참고 문헌 29인용 수 11
한 줄 요약

이 논문은 문장 임베딩 모델로 BERT와 ALBERT를 평가하며, 후행 NLP 작업에 대해 Sentence-ALBERT (SALBERT)와 CNN 기반 문장 임베딩 아키텍처를 제안한다. 파라미터 수가 적음에도 불구하고 ALBERT 기반 모델은 경쟁력 있는 성능을 보이며, CNN 아키텍처는 STS 벤치마크에서 SALBERT의 스피어만 상관계수를 최대 8점 향상시켜 BERT 모델의 1점 향상보다는 훨씬 더 뚜렷한 개선 효과를 보였다.

ABSTRACT

Contextualized representations from a pre-trained language model are central to achieve a high performance on downstream NLP task. The pre-trained BERT and A Lite BERT (ALBERT) models can be fine-tuned to give state-ofthe-art results in sentence-pair regressions such as semantic textual similarity (STS) and natural language inference (NLI). Although BERT-based models yield the [CLS] token vector as a reasonable sentence embedding, the search for an optimal sentence embedding scheme remains an active research area in computational linguistics. This paper explores on sentence embedding models for BERT and ALBERT. In particular, we take a modified BERT network with siamese and triplet network structures called Sentence-BERT (SBERT) and replace BERT with ALBERT to create Sentence-ALBERT (SALBERT). We also experiment with an outer CNN sentence-embedding network for SBERT and SALBERT. We evaluate performances of all sentence-embedding models considered using the STS and NLI datasets. The empirical results indicate that our CNN architecture improves ALBERT models substantially more than BERT models for STS benchmark. Despite significantly fewer model parameters, ALBERT sentence embedding is highly competitive to BERT in downstream NLP evaluations.

연구 동기 및 목표

  • Semantic textual similarity (STS) 및 natural language inference (NLI)와 같은 후행 NLP 작업에서 BERT와 ALBERT 문장 임베딩의 성능을 평가하는 것.
  • 더 적은 파라미터를 가진 ALBERT가 BERT와 비교해 경쟁적인 문장 임베딩 성능을 달성할 수 있는지 조사하는 것.
  • 특히 시아모이스 네트워크와 CNN을 포함한 대체 문장 임베딩 아키텍처가 BERT와 ALBERT 기반 모델에 얼마나 효과적인지 탐색하는 것.
  • ALBERT의 파라미터 공유 불안정성으로 인해 CNN 기반 아키텍처가 BERT보다 ALBERT에 더 큰 성능 향상을 가져오는지 여부를 판단하는 것.
  • STSb 및 NLI 데이터셋을 혼합해 테스트하는 미세조정이 STS 작업 전반(2012–2016)에 걸쳐 일반화 능력을 향상시키는지 평가하는 것.

제안 방법

  • Sentence-BERT (SBERT)의 시아모이스 및 트리플렛 네트워크 아키텍처에 BERT 대신 ALBERT를 적용해 Sentence-ALBERT (SALBERT)를 제안한다.
  • BERT 또는 ALBERT의 토큰 임베딩을 처리해 고정 크기의 문장 벡터를 생성하는 CNN 기반 문장 임베딩 모듈을 도입한다.
  • 비교를 위해 평균 풀링과 [CLS] 토큰 풀링을 기준 문장 임베딩 방법으로 사용한다.
  • 모델을 모두 STSb 및 NLI(MultiNLI/SNLI) 훈련 세트의 병합된 데이터셋에 대해 미세조정하여 STS 작업에서의 일반화 능력을 향상시킨다.
  • STS 벤치마크 세트(STS12–STS16)에서 주로 스피어만 상관계수를 평가 지표로 사용한다.
  • 모델 아키텍처와 사전학습 목표(예: SOP 대비 NSP)가 후행 성능의 안정성과 정확성에 미치는 영향을 분석한다.
Figure 1: Siamese network structure used in SBERT and SALBERT
Figure 1: Siamese network structure used in SBERT and SALBERT

실험 결과

연구 질문

  • RQ1STS 및 NLI 작업에서 ALBERT 기반 문장 임베딩 모델은 BERT 기반 모델과 비교해 어떤 성능을 보이는가?
  • RQ2문장 임베딩에 CNN 기반 아키텍처를 도입할 경우, BERT 및 ALBERT 기반 모델의 성능 향상 정도는 어느 정도인가?
  • RQ3ALBERT의 초기 성능이 낮음에도 불구하고 CNN 아키텍처가 ALBERT에 비해 BERT보다 더 큰 성능 향상을 가져오는 이유는 무엇인가?
  • RQ4STSb 및 NLI 데이터셋을 동시에 미세조정하면, STSb 단독 또는 NLI 단독으로 미세조정하는 것보다 여러 STS 작업(2012–2016)에 걸쳐 더 나은 일반화를 이끌어내는가?
  • RQ5ALBERT의 파라미터 공유 메커니즘이 초래하는 불안정성은 어떻게 영향을 미치며, CNN과 같은 아키텍처 수정으로 이를 완화할 수 있는가?

주요 결과

  • CNN 기반 문장 임베딩 아키텍처는 STS 벤치마크에서 ALBERT 기반 모델의 스피어만 상관계수를 최대 8점 향상시키지만, BERT 기반 모델의 경우 단지 1점 향상됨.
  • 매우 적은 파라미터를 가짐에도 불구하고 ALBERT 기반 문장 임베딩은 후행 NLP 작업에서 BERT 기반 모델과 경쟁 가능한 성능을 보인다.
  • SALBERT(시아모이스 아키텍처를 적용한 ALBERT)는 SBERT(BERT에 시아모이스 아키텍처 적용)보다 성능이 열 劣하나, CNN 아키텍처를 적용하면 이 격차가 해소된다.
  • CNN 아키텍처는 STS12–STS16 전반에 걸쳐 SALBERT의 성능을 평균 2점 향상시키지만, BERT 기반 모델에는 거의 영향을 주지 않는다.
  • STSb 및 NLI 데이터셋을 모두 사용해 미세조정하면 STSb에서 가장 높은 성능을 기록하며, STSb 또는 NLI 단독으로 미세조정하는 것보다 뛰어난 성능을 낸다.
  • ALBERT의 파라미터 공유 메커니즘이 유도하는 불안정성은 CNN 아키텍처로 완화될 수 있으며, 이는 BERT에 비해 ALBERT에서 더 큰 성능 향상이 이루어지는 이유를 설명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.