Skip to main content
QUICK REVIEW

[논문 리뷰] T-BERT -- Model for Sentiment Analysis of Micro-blogs Integrating Topic Model and BERT

Sarojadevi Palani, Prabhu Rajagopal|arXiv (Cornell University)|2021. 06. 02.
Sentiment Analysis and Opinion Mining참고 문헌 34인용 수 10
한 줄 요약

이 논문은 BERT의 문맥 임베딩과 LDA 기반 토픽 모델링을 통합하여 원시 미크로블로그 데이터에서의 감성 분석을 향상시키는 새로운 프레임워크인 T-BERT를 제안한다. 자동에코더를 통해 문맥 토픽을 융합하고, 감성 분류 작업에 대해 BERT를 피지테이닝함으로써 모델은 90.81%의 정확도를 달성하였으며, 이는 주어진 비지도, 단문 소셜 미디어 데이터에서 주제 인식 문맥 표현이 감성 분류 성능을 향상시킨다는 것을 보여준다.

ABSTRACT

Sentiment analysis (SA) has become an extensive research area in recent years impacting diverse fields including ecommerce, consumer business, and politics, driven by increasing adoption and usage of social media platforms. It is challenging to extract topics and sentiments from unsupervised short texts emerging in such contexts, as they may contain figurative words, strident data, and co-existence of many possible meanings for a single word or phrase, all contributing to obtaining incorrect topics. Most prior research is based on a specific theme/rhetoric/focused-content on a clean dataset. In the work reported here, the effectiveness of BERT(Bidirectional Encoder Representations from Transformers) in sentiment classification tasks from a raw live dataset taken from a popular microblogging platform is demonstrated. A novel T-BERT framework is proposed to show the enhanced performance obtainable by combining latent topics with contextual BERT embeddings. Numerical experiments were conducted on an ensemble with about 42000 datasets using NimbleBox.ai platform with a hardware configuration consisting of Nvidia Tesla K80(CUDA), 4 core CPU, 15GB RAM running on an isolated Google Cloud Platform instance. The empirical results show that the model improves in performance while adding topics to BERT and an accuracy rate of 90.81% on sentiment classification using BERT with the proposed approach.

연구 동기 및 목표

  • 원시적이고 비지도된 미크로블로그 데이터에서 잠재 토픽 모델링과 문맥 BERT 임베딩을 통합함으로써 감성 분석 성능을 향상시키는 프레임워크를 개발하는 것.
  • BERT의 문맥 이해 능력과 LDA의 토픽 발견 기능을 융합하여 단문 소셜 미디어에서의 토픽의 해석 가능성과 의미적 관련성을 향상시키는 것.
  • 토픽 정보를 BERT 임베딩과 융합함으로써 감성 분류 정확도에 측정 가능한 향상이 이루어지는지 입증하는 것.
  • 자기에코더를 사용하여 BERT 문맥 문장 임베딩과 LDA에서 유도된 토픽을 정렬하고 융합하는 방법의 효과를 평가하는 것.
  • 시장 조사, 브랜드 모니터링, 소셜 네트워크 분석과 같은 분야에서 실시간 감성 분석에 적용 가능한 유연하고 일반화 가능한 접근법을 제공하는 것.

제안 방법

  • 프레임워크는 원시 미크로블로그 텍스트에서 문맥 문장 임베딩을 생성하기 위해 BERT-base-uncased를 사용한다.
  • 동일한 텍스트 코퍼스에서 잠재 디리클레 분할(LDA)을 적용하여 기저 주제를 식별한다.
  • ReLU 활성화 함수와 L1 정규화를 사용하여 과적합을 방지하면서, 공유된 잠재 표현을 학습함으로써 BERT 임베딩과 LDA 토픽을 융합하기 위해 자동에코더를 훈련시킨다.
  • 융합된 표현은 최종 밀도층을 갖춘 피지테이닝된 BERT 분류기에 입력되어 감성 예측(긍정, 부정, 중립)을 수행한다.
  • 하이퍼파라미터는 Adam 옵timizer를 사용하고 드롭아웃 비율 0.01과 L1 정규화(10e-4)를 적용하여 일반화 성능을 향상시킨다.
  • 모델 훈련은 테슬라 K80 GPU를 탑재한 Google 클라우드 플랫폼 인스턴스에서 수행되었으며, 배치 크기 128과 50개의 훈련 에포크를 사용하였다.

실험 결과

연구 질문

  • RQ1BERT의 문맥 임베딩과 LDA에서 도출된 토픽을 융합하는 것이 원시 미크로블로그 데이터에서의 감성 분류 정확도를 향상시키는가?
  • RQ2토픽 모델링과 문맥 임베딩의 융합이 발견된 토픽의 일관성과 해석 가능성에 어떤 영향을 미치는가?
  • RQ3T-BERT 프레임워크에서 토픽 일관성과 감성 분류 성능을 최대화하는 최적의 토픽 수(k)는 얼마인가?
  • RQ4BERT와 LDA 표현을 정렬하고 융합하기 위해 자동에코더를 사용할 경우, 단독 LDA나 BERT 클러스터링에 비해 더 나은 클러스터링 및 의미적 토픽 그룹화를 이끌어내는가?
  • RQ5실제 비지도 미크로블로그 데이터셋에서 T-BERT 프레임워크가 표준 BERT와 LDA 전용 모델에 비해 감성 분류 성능에서 얼마나 뛰어난가?

주요 결과

  • T-BERT 모델은 테스트 세트에서 감성 분류 정확도 90.81%를 달성하여 기준 모델들을 뛰어넘었다.
  • LDA+BERT 융합 모델은 일관성 점수 0.56을 기록하여 LDA(0.501)와 BERT 클러스터링(0.521)을 모두 초월하여 향상된 토픽 품질을 나타냈다.
  • LDA+BERT 모델의 실루엣 점수는 0.46에 도달하여 잘 분리되고 의미 있는 토픽 클러스터를 나타냈으며, BERT 전용 클러스터링의 0.044와 대비해 뚜렷한 개선을 보였다.
  • k=8 토픽에 대한 워드 클라우드 시각화 결과, 높은 빈도와 문맥적으로 관련된 단어들이 함께 그룹화되어 토픽의 해석 가능성이 향상됨을 확인했다.
  • 모델은 긍정 감성에 대해 96%의 클래스별 정확도를 보였고, 부정 감성은 78%, 중립 감성은 69%였으며, 이는 긍정 감성 탐지에서 뛰어난 성능을 보임을 시사한다.
  • L1 정규화와 드롭아웃(0.01)을 적용한 자동에코더는 과적합을 효과적으로 줄였고, 훈련/검증 손실 곡선은 안정적인 수렴을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.