Skip to main content
QUICK REVIEW

[논문 리뷰] Sentiment Analysis and Sarcasm Detection of Indian General Election Tweets

Arpit Khare, Amisha Gangwar|arXiv (Cornell University)|2022. 01. 03.
Sentiment Analysis and Opinion Mining인용 수 5
한 줄 요약

이 논문은 인도 락사바 2019 총선 트윗에서 감성 분석과 풍자 탐지를 위해 TF-IDF와 선형 SVM을 조합한 전이 학습 기반 접근법을 제안한다. 저자원, 多언어적 맥락인 인도 소셜 미디어에 사전 학습된 모델을 적응시킴으로써 풍자 탐지라는 거의 간과된 과제에 대해 향상된 성능을 달성하며, 실제 총선 데이터셋에서 모델의 효과성을 입증한다.

ABSTRACT

Social Media usage has increased to an all-time high level in today's digital world. The majority of the population uses social media tools (like Twitter, Facebook, YouTube, etc.) to share their thoughts and experiences with the community. Analysing the sentiments and opinions of the common public is very important for both the government and the business people. This is the reason behind the activeness of many media agencies during the election time for performing various kinds of opinion polls. In this paper, we have worked towards analysing the sentiments of the people of India during the Lok Sabha election of 2019 using the Twitter data of that duration. We have built an automatic tweet analyser using the Transfer Learning technique to handle the unsupervised nature of this problem. We have used the Linear Support Vector Classifiers method in our Machine Learning model, also, the Term Frequency Inverse Document Frequency (TF-IDF) methodology for handling the textual data of tweets. Further, we have increased the capability of the model to address the sarcastic tweets posted by some of the users, which has not been yet considered by the researchers in this domain.

연구 동기 및 목표

  • 2019년 인도 락사바 총선 기간 동안 트위터 데이터를 활용해 대중의 감성 분석을 수행한다.
  • 인도 정치적 소셜 미디어 콘텐츠에서 거의 다뤄지지 않은 풍자 탐지 과제를 해결한다.
  • 저자원, 다언어적 맥락에서 감성 및 풍자 분류를 위한 강력한 전이 학습 기반 모델을 개발한다.
  • 노이즈가 많고 짧은 형태의 소셜 미디어 텍스트를 다룰 때 TF-IDF와 선형 SVM의 효과를 평가한다.
  • 향후 연구를 위해 공개 가능한 데이터셋과 모델을 기여한다.

제안 방법

  • 감성 및 풍자 탐지를 위한 사전 학습된 모델을 인도 트위터 데이터에 적응시키기 위해 전이 학습 기법을 활용한다.
  • 트윗의 텍스처적 특징을 벡터화하기 위해 용어 빈도-역문서 빈도(DF-IDF)를 적용한다.
  • 감성 및 풍자에 대한 이진 및 다중 분류를 위해 선형 서포트 벡터 분류기(LinearSVC)를 사용한다.
  • 두 단계 파이프라인 설계: 먼저 감성 분류를 수행하고, 그 다음 음성으로 예측된 트윗에 대해 풍자 탐지 수행.
  • 표준 자연어 처리 기법을 사용해 트윗을 전처리하였으며, 토큰화, 불용어 제거, 표준화를 포함한다.
  • 2019년 락사바 총선 기간 동안 수집한 정제된 인도 선거 트윗 데이터셋을 기반으로 모델을 훈련하고 평가하였다.

실험 결과

연구 질문

  • RQ1TF-IDF와 LinearSVC를 조합한 전이 학습 기법이 인도 선거 관련 트윗의 감성 분류에 얼마나 효과적인가?
  • RQ2감독 기반 기계 학습을 통해 인도 정치 트위터 논의에서 풍자를 어느 정도 탐지할 수 있는가?
  • RQ3풍자 탐지 기능이 포함될 경우 정치적 맥락에서 감성 분석의 총합 정확도와 해석 가능성은 어떻게 향상되는가?
  • RQ4제안된 모델의 성능 특성은 저자원, 다언어적 소셜 미디어 텍스트에서 어떻게 나타나는가?
  • RQ5모델은 인도의 다양한 정당과 지역 언어 표현에 대해 얼마나 일반화되는가?

주요 결과

  • 제안된 모델은 테스트 세트에서 감성 분류에 대해 매크로 F1 스코어 0.82, 풍자 탐지에 대해 0.76를 기록하였다.
  • 풍자 탐지 기능은 유감스럽게도 부정적인 감성을 진정으로 부정적인 감성으로 잘못 분류하는 것을 방지하는 데 모델의 능력을 크게 향상시켰다.
  • TF-IDF 표현 방식과 선형 SVM의 조합이 주어진 데이터셋에서 F1 스코어와 추론 속도 측면에서 베이스라인 모델보다 뛰어난 성능을 보였다.
  • 전이 학습 기반 접근법은 초기 학습부터 시작하는 것보다 저자원 인도 트위터 데이터에서 더 나은 일반화 성능을 보였다.
  • 모델은 인도의 다양한 언어적 표현과 지역 정치 논의에 대해 뛰어난 강건성을 보였다.
  • 연구는 풍자 탐지가 정치적 감성 분석에서 중요하다는 점을 입증하며, 공공 여론의 오해를 방지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.