Skip to main content
QUICK REVIEW

[논문 리뷰] Does BERT Understand Sentiment? Leveraging Comparisons Between Contextual and Non-Contextual Embeddings to Improve Aspect-Based Sentiment Models

Natesh Reddy, Pranaydeep Singh|arXiv (Cornell University)|2020. 11. 23.
Sentiment Analysis and Opinion Mining인용 수 6
한 줄 요약

이 논문은 BERT의 문맥적 임베딩과 비문맥적 GloVe 임베딩을 비교하여 감성 극성을 추론함으로써, 감성 분류 성능을 향상시키는 경량화된 방법 BERT-IL을 제안한다. 단순한 비교 네트워크를 훈련하고 BERT의 일부 레이어만 미세조정함으로써, 기존 방법에 비해 모델 크기를 최대 65% 감소시키고 훈련 시간을 최대 75% 줄이며 SemEval 2014 및 SemEval 2016 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

When performing Polarity Detection for different words in a sentence, we need to look at the words around to understand the sentiment. Massively pretrained language models like BERT can encode not only just the words in a document but also the context around the words along with them. This begs the questions, "Does a pretrain language model also automatically encode sentiment information about each word?" and "Can it be used to infer polarity towards different aspects?". In this work we try to answer this question by showing that training a comparison of a contextual embedding from BERT and a generic word embedding can be used to infer sentiment. We also show that if we finetune a subset of weights the model built on comparison of BERT and generic word embedding, it can get state of the art results for Polarity Detection in Aspect Based Sentiment Classification datasets.

연구 동기 및 목표

  • BERT가 전체 미세조정 없이도 요소어휘에 대한 감성 정보를 내재적으로 캡처하는지 여부를 조사하는 것.
  • BERT와 GloVe 임베딩 간의 비교를 활용하여 요소 극성 검출을 위한 경량 모델을 개발하는 것.
  • 계산 비용과 훈련 시간을 최소화하면서도 표준 ABSA 벤치마크에서 최신 기술 수준의 성능을 달성하는 것.
  • 전체 BERT 미세조정을 피하여 모델 효율성을 높이고 이산화탄소 배출량을 줄이는 것.
  • 비교 기반 감성 추론 메커니즘을 통해 더 나은 도메인 일반화를 달성하는 것.

제안 방법

  • 모델은 BERT의 문맥적 임베딩과 요소어휘의 비문맥적 GloVe 임베딩을 입력으로 사용하는 비교 네트워크를 사용한다.
  • 학습된 비교 메커니즘이 두 임베딩 유형 간의 유사도 또는 차이 표현을 계산하여 감성 극성을 추론한다.
  • 비교 네트워크는 동결된 BERT와 GloVe 임베딩 위에 최소한의 학습 가능한 파rameter를 가진 채로 엔드 투 엔드로 훈련된다.
  • 성능 향상을 위해 BERT-IL 미세조정 버전에서는 BERT의 마지막 다섯 레이어를 미세조정한다.
  • 다양한 BERT 레이어의 표현을 결합하여 맥락 해상도를 향상시키기 위해 AutoInt와 같은 상호작용 레이어를 사용한다.
  • 표준 ABSA 메트릭을 사용하여 SemEval 2014, SemEval 2016, SentiHood 데이터셋에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1BERT는 전체 미세조정 없이도 요소어휘에 대한 감성 정보를 내재적으로 캡처하는가?
  • RQ2문맥적(BERT)과 비문맥적(GloVe) 임베딩 간의 단순한 비교가 요소 수준의 감성을 효과적으로 추론할 수 있는가?
  • RQ3이 비교 기반의 경량 모델이 최소한의 계산 비용으로 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4비교 기반 모델의 성능은 전체 BERT 미세조정 및 기타 최신 기술 수준 방법에 비해 정확도, 크기, 훈련 시간 측면에서 어떻게 비교되는가?
  • RQ5특히 전체 미세조정이 비실현적인 경우, 이 방법은 제한된 데이터로도 잘 일반화되는가?

주요 결과

  • BERT-IL 미세조정 버전은 SemEval 2014 및 SemEval 2016에서 최신 기술 수준 성능을 달성했으며, SemEval 2016의 서브태스크 1에서 HAABSA보다 0.7% 높은 성능을 기록했다.
  • SentiHood 데이터셋에서 BERT-IL 미세조정 버전은 90.8%의 정확도를 달성했으며, BERT 기준선을 초월하고 BERT-pair-QAM과 같은 더 복잡한 모델과 경쟁 수준의 성능을 보였다.
  • BERT-IL 모델은 모델 크기가 단지 1119MB이고, 순전파/역전파가 각각 0.08초로, 기존 방법 대비 최대 3배 작고 4배 빠르게 작동하여 SemEval 2014에서 84.6%의 정확도를 기록했다.
  • BERT-IL 미세조정 버전은 BAT 및 BERT-PT와 같은 최신 기술 수준 모델에 비해 훈련 시간을 최대 75% 감소시키고 모델 크기를 최대 65% 줄였다.
  • 비교 기반 방법은 전체 BERT 미세조정 없이도 강력한 성능을 보였으며, 이는 감성 정보가 BERT의 문맥적 표현에 암묵적으로 캡처되어 있음을 시사한다.
  • 이 방법은 SentiHood와 같이 데이터 증강으로 인해 훈련 세트 크기가 3배 큰 데이터셋에서도 견고한 성능을 보였으며, 확장성과 일반화 잠재력이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.