Skip to main content
QUICK REVIEW

[논문 리뷰] An Ensemble Model for Sentiment Analysis of Hindi-English Code-Mixed Data

Madan Gopal Jhanwar, Arpita Das|arXiv (Cornell University)|2018. 06. 12.
Sentiment Analysis and Opinion Mining참고 문헌 6인용 수 20
한 줄 요약

이 논문은 히ン두-영어 혼합 소셜 미디어 텍스트의 감성 분석을 위해 문자 3-그램 기반 LSTM과 단어 n-그램 기반 다항 나이브 베이즈(MNB) 분류기를 조합한 앙상블 모델을 제안한다. LSTM이 순서 패턴 학습을 수행하고 MNB가 키워드의 극성 검출을 수행함으로써, 앙상블 모델은 최신 기술 수준의 성능을 달성하여 실제 데이터셋에서 70.8%의 정확도를 기록하며, 전통적 및 딥 러닝 기반 베이스라인을 모두 능가한다.

ABSTRACT

In multilingual societies like India, code-mixed social media texts comprise the majority of the Internet. Detecting the sentiment of the code-mixed user opinions plays a crucial role in understanding social, economic and political trends. In this paper, we propose an ensemble of character-trigrams based LSTM model and word-ngrams based Multinomial Naive Bayes (MNB) model to identify the sentiments of Hindi-English (Hi-En) code-mixed data. The ensemble model combines the strengths of rich sequential patterns from the LSTM model and polarity of keywords from the probabilistic ngram model to identify sentiments in sparse and inconsistent code-mixed data. Experiments on reallife user code-mixed data reveals that our approach yields state-of-the-art results as compared to several baselines and other deep learning based proposed methods.

연구 동기 및 목표

  • 저자원, 노이즈가 많고 언어적으로 일관성 없는 히ン두-영어 혼합 소셜 미디어 텍스트에서 감성 분석을 해결하기 위해.
  • 코드 믹스 데이터에서 흔히 발생하는 희귀어 또는 OOV 토큰을 다루는 데에 어려움을 겪는 딥 러닝 모델의 한계를 극복하기 위해.
  • 순서 모델링(LSTM)의 강점과 키워드 수준의 극성 검출(MNB)을 조합하여 감성 분류 정확도를 향상시키기 위해.
  • 기존의 n-그램 모델이 저자원 코드 믹스 환경에서 딥 러닝 모델의 성능을 향상시킬 수 있다는 가설을 검증하기 위해.
  • 희박하고 일관성 없는 코드 믹스 데이터에서 단독 모델보다 더 잘 일반화되는 강력한 하이브리드 접근법을 제시하기 위해.

제안 방법

  • 모델은 양방향 LSTM 네트워크에서 서브워드 특징으로서 문자 3-그램을 사용하여 코드 믹스 텍스트의 순서적 및 형태학적 패턴을 포착한다.
  • 별도의 다항 나이브 베이즈(MNB) 분류기가 단어 n-그램(일반형 및 이형)을 기반으로 키워드 조합으로부터 감성을 검출하도록 훈련된다.
  • 두 모델의 출력은 확률 곱셈을 통해 결합되며, 검증 세트 정확도에 따라 가중치가 부여되어 최종 예측을 도출한다.
  • 앙상블 전략은 LSTM의 장거리 의존성 모델링 능력과 MNB가 희귀어 또는 슬랭 키워드의 감성 검출에서의 강점을 활용한다.
  • 최종 예측은 개별 모델의 확률 곱의 최대값을 갖는 클래스를 선택하여 이루어진다.
  • 모델은 개발 세트에서 초모수를 튜닝하고 실생활 히ン두-영어 혼합 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1딥 러닝과 전통적 확률 모델을 조합한 하이브리드 모델이 저자원, 코드 믹스 히ン두-영어 텍스트에서 감성 분류 정확도를 향상시킬 수 있는가?
  • RQ2문자 3-그램 기반 LSTM과 단어 n-그램 기반 MNB 모델은 코드 믹스 데이터의 언어적 희박성과 일관성 부족 문제를 어떻게 상호보완하는가?
  • RQ3MNB에서 유도된 n-그램 특징의 통합이 희귀어 또는 철자 오류가 있는 감성 유발 단어에서 LSTM의 일반화 실패를 완화하는 데 기여하는가?
  • RQ4이 맥락에서 딥 러닝 모델과 전통적 분류기의 출력을 융합하는 데 가장 적합한 방법은 무엇인가?
  • RQ5앙상블 모델은 코드 믹스 감성 분석에서 단독 딥 러닝 및 전통 기계 학습 베이스라인을 얼마나 뛰어나게 능가하는가?

주요 결과

  • 제안된 앙상블 모델은 테스트 세트에서 70.8%의 정확도를 기록하며, SVM, MNB 및 기타 딥 러닝 접근법을 포함한 모든 베이스라인 모델을 능가한다.
  • 앙상블 모델은 F1-score 0.661을 기록하여 다음으로 성능이 좋은 모델(서브워드 조합 기반 LSTM, 0.652)보다 유의미하게 높은 성능을 보였다.
  • 확률 곱셈 기반 융합 전략은 가중선형 조합(69.1%)보다 더 높은 성능(70.8%)을 기록하여 두 모델 간의 강한 상호보완성이 있음을 시사한다.
  • 정성 분석 결과, MNB 모델은 'fadu'(아주 멋지다) 또는 'c******'(바보)와 같은 희귀어나 슬랭어를 감성적으로 잘 식별하는 데 뛰어나며, LSTM은 이러한 단어가 훈련 데이터에서 빈도가 낮아 일반화에 실패한다.
  • LSTM은 순서적 의존성을 모델링할 수 있어 더 긴 복잡한 문장에서 더 우수한 성능을 보이며, MNB는 철자 오류와 어휘 다양성에 더 강건하다.
  • 결과적으로, 순서 모델링과 키워드 수준의 극성 검출을 조합함으로써 저자원, 노이즈가 많은 코드 믹스 환경에서의 정확성과 강건성이 향상됨을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.