Skip to main content
QUICK REVIEW

[논문 리뷰] Arabic aspect based sentiment classification using BERT.

Mohammed M. Abdelgwad|arXiv (Cornell University)|2021. 11. 29.
Sentiment Analysis and Opinion Mining참고 문헌 34인용 수 5
한 줄 요약

이 논문은 문맥 임베딩과 문장 쌍 입력을 활용하여 감성 극성 예측 성능을 향상시키기 위해 BERT 기반 신경 모델을 제안한다. 이 모델은 아랍어 호텔 리뷰에서 89.51%의 정확도, 책 리뷰에서 73%, 뉴스 데이터에서 85.73%의 정확도를 기록하며 기존의 정적 워드 임베딩에 의존하는 방법들을 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Aspect-based sentiment analysis(ABSA) is a textual analysis methodology that defines the polarity of opinions on certain aspects related to specific targets. The majority of research on ABSA is in English, with a small amount of work available in Arabic. Most previous Arabic research has relied on deep learning models that depend primarily on context-independent word embeddings (e.g.word2vec), where each word has a fixed representation independent of its context. This article explores the modeling capabilities of contextual embeddings from pre-trained language models, such as BERT, and making use of sentence pair input on Arabic aspect sentiment polarity classification task. In particular, we develop a simple but effective BERT-based neural baseline to handle this task. Our BERT architecture with a simple linear classification layer surpassed the state-of-the-art works, according to the experimental results on three different Arabic datasets. Achieving an accuracy of 89.51% on the Arabic hotel reviews dataset, 73% on the Human annotated book reviews dataset, and 85.73% on the Arabic news dataset.

연구 동기 및 목표

  • 문맥 기반 단어 표현을 활용하여 효과적인 아랍어 ABSA 모델 부족 문제를 해결하기 위해.
  • 정적 워드 임베딩을 아랍어 텍스트의 감성 분류 정확도 향상을 위해 BERT에서 유도된 문맥 기반 임베딩으로 대체함으로써.
  • 아랍어에서 요소 감성 극성 분류를 위한 단순하면서도 효과적인 BERT 기반 기준 모델을 개발하기 위해.
  • 다양한 아랍어 텍스트 도메인, 특히 리뷰와 뉴스를 포함한 다양한 도메인에서 모델 성능을 평가하기 위해.
  • 저자원 아랍어 NLP 작업에서 기존의 딥러닝 접근 방식에 비해 사전에 훈련된 문맥 기반 모델의 우수성을 입증하기 위해.

제안 방법

  • 문장 쌍 입력 형식을 사용하여 아랍어 ABSA 데이터셋에 사전 훈련된 BERT 모델을 미세조정하는 방식.
  • 감성 분류를 위해 대상 요소와 해당 요소의 문맥 문장을 조합한 입력 쌍을 구성하는 방식.
  • 감성 예측을 위해 BERT의 [CLS] 토큰 표현 위에 간단한 선형 분류층을 적용하는 방식.
  • 단어 표현이 주변 문맥에 따라 동적으로 조정되는 BERT의 문맥 임베딩을 활용하는 방식.
  • 표준 교차 엔트로피 손실을 사용하여 세 가지의 다른 아랍어 데이터셋에서 끝에서 끝까지 모델을 훈련하는 방식.
  • 학습률 스케줄링과 가중치 감소를 포함한 표준 BERT 미세조정 절차를 적용하는 방식.

실험 결과

연구 질문

  • RQ1정적 워드 임베딩에 비해 BERT 기반 문맥 임베딩이 아랍어 요소 기반 감성 분류에 성능 향상을 이끌 수 있는가?
  • RQ2문장 쌍 입력을 사용한 단순한 BERT 미세조정 접근 방식이 아랍어 ABSA 작업에 얼마나 효과적인가?
  • RQ3제안된 모델이 여러 아랍어 텍스트 데이터셋에서 기존 최신 기술 수준의 방법들을 능가하는가?
  • RQ4호텔 리뷰, 책 리뷰, 뉴스 기사와 같은 다양한 아랍어 텍스트 도메인에서 모델의 성능은 얼마나 견고한가?
  • RQ5저자원 아랍어 NLP 환경에서 문맥 표현이 감성 분류 정확도에 어떤 영향을 미치는가?

주요 결과

  • 제안된 BERT 기반 모델은 아랍어 호텔 리뷰 데이터셋에서 89.51%의 정확도를 기록하며 이전 최신 기술 수준의 방법들을 능가했다.
  • 인간이 애너테이션한 책 리뷰 데이터셋에서는 73%의 정확도를 달성하여 도메인 특화 아랍어 텍스트에서 강력한 성능을 보였다.
  • 아랍어 뉴스 데이터셋에서는 85.73%의 정확도를 기록하여 다양한 텍스트 유형에서의 효과성을 입증했다.
  • 결과는 BERT에서 유도된 문맥 임베딩이 아랍어 ABSA에서 문맥 독립적 워드 임베딩보다 뚜렷이 뛰어나다는 것을 확인했다.
  • 간단한 문장 쌍 입력을 사용한 미세조정 접근 방식이 매우 효과적이었으며, 향후 아랍어 ABSA 연구를 위한 강력한 기준 모델을 확립했다.
  • 세 가지 데이터셋 전반에서의 모델 성능은 BERT 기반 아키텍처가 저자원 아랍어 NLP 응용 분야에서 일반화 능력을 지닌다는 것을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.