Skip to main content
QUICK REVIEW

[논문 리뷰] Sentiment Analysis for YouTube Comments in Roman Urdu

Tooba Tehreem|arXiv (Cornell University)|2021. 02. 19.
Sentiment Analysis and Opinion Mining참고 문헌 23인용 수 4
한 줄 요약

이 연구는 다섯 가지 기계학습 모델을 사용하여 로마어우르두어 YouTube 댓글에 대한 감성 분석 프레임워크를 제안한다. Bag-of-words 특성 추출을 적용하고 14,131개의 샘플 데이터셋에서 분류기 성능을 평가한 결과, SVM가 64%의 최고 정확도를 기록하여 나이브 베이즈, 선형 회귀, KNN, MLP를 모두 앞섰다.

ABSTRACT

Sentiment analysis is a vast area in the Machine learning domain. A lot of work is done on datasets and their analysis of the English Language. In Pakistan, a huge amount of data is in roman Urdu language, it is scattered all over the social sites including Twitter, YouTube, Facebook and similar applications. In this study the focus domain of dataset gathering is YouTube comments. The Dataset contains the comments of people over different Pakistani dramas and TV shows. The Dataset contains multi-class classification that is grouped The comments into positive, negative and neutral sentiment. In this Study comparative analysis is done for five supervised learning Algorithms including linear regression, SVM, KNN, Multi layer Perceptron and Naïve Bayes classifier. Accuracy, recall, precision and F-measure are used for measuring performance. Results show that accuracy of SVM is 64 percent, which is better than the rest of the list.

연구 동기 및 목표

  • 파키스탄에서 널리 사용되는 비공식 철자인 로마어우르두어로 작성된 사용자 댓글의 자동 감성 분류를 가능하게 하기 위해.
  • 저자원 언어 유형인 로마어우르두어에서 감성 분석을 위한 레이블이 부여된 데이터셋과 모델의 부족 문제를 해결하기 위해.
  • 다중 클래스(긍정, 부정, 중립) 로마어우르두어 댓글 데이터셋에서 다섯 가지 지도 학습 알고리즘—나이브 베이즈, 선형 회귀, SVM, KNN, MLP—의 성능을 비교하기 위해.
  • 10겹 교차 검증을 통해 정확도, 정밀도, 재현율, F1 점수와 같은 표준 지표를 사용하여 모델 성능을 평가하기 위해.
  • 남아시아 언어의 저자원, 스크립트 특화 감성 분석 분야의 향후 연구를 위한 기초 자료 제공하기 위해.

제안 방법

  • Kaggle에서 14,131개의 로마어우르두어 YouTube 댓글로 구성된 레이블이 부여된 데이터셋을 확보하였으며, 감성 레이블(긍정, 부정, 중립)은 수동으로 할당되었다.
  • 텍스트 전처리 과정으로 null 값 제거 및 벡터화를 위한 단어 토큰화를 수행하였다.
  • 텍스트 코퍼스에서 가장 빈도가 높은 3,000개의 특성 추출을 위해 bag-of-words(BoW) 기법을 사용하였다.
  • 정확한 평가를 보장하기 위해 10겹 교차 검증을 사용하여 데이터셋을 90% 훈련 세트와 10% 테스트 세트로 분할하였다.
  • 나이브 베이즈, 선형 회귀, SVM, K-가장 가까운 이웃(KNN), 다층 퍼셉트론(MLP) 등 다섯 가지 지도 학습 분류기를 훈련 및 평가하였다.
  • 성능 평가에는 혼동 행렬과 정확도, 정밀도, 재현율, F1 점수와 같은 표준 지표를 사용하였으며, 결과는 10회 반복 평균을 취해 산출하였다.

실험 결과

연구 질문

  • RQ1로마어우르두어 YouTube 댓글의 감성 분류에 가장 적합한 지도 기계학습 알고리즘이 무엇인가?
  • RQ2기존의 분류기들(예: SVM, 나이브 베이즈)과 신경망(예: MLP) 간의 성능은 저자원 로마어우르두어 텍스트에서 어떻게 비교되는가?
  • RQ3특성 선택(3,000개 특성으로 구성된 bag-of-words)이 비공식적인 로마어우르두어 감성 분석에서 모델 정확도에 어떤 영향을 미치는가?
  • RQ4데이터셋의 감성 분포는 얼마나 균형 잡혀 있으며, 클래스 불균형이 모델 일반화에 영향을 미치는가?
  • RQ5제한된 레이블이 부여된 데이터를 바탕으로 다중 클래스 감성 분류 모델이 저자원 언어인 로마어우르두어에서 만족스러운 성능을 달성할 수 있는가?

주요 결과

  • SVM는 테스트 세트에서 64%의 최고 정확도를 기록하여 비교 평가에서 모든 다른 모델을 앞섰다.
  • 나이브 베이즈는 정확도가 60% 이하로 낮은 성능을 보이며, 로마어우르두어의 언어적 복잡성 처리에 한계를 드러냈다.
  • 선형 회귀는 SVM 및 KNN보다 정확도가 현저히 낮게 나타나 이 다중 클래스 NLP 작업에 부적합함을 시사한다.
  • KNN과 MLP는 유사한 성능을 보였으며, 선형 회귀를 능가했지만 SVM에 비해 성능이 열등했고, F1 점수는 약 0.55~0.58 수준이었다.
  • 데이터셋은 불균형한 분포를 보였으며, 중립 댓글이 48%, 긍정이 29%, 부정이 24%로, 이는 모델의 편향과 일반화 능력에 영향을 줄 수 있었다.
  • 전반적인 정확도가 낮음에도 불구하고, SVM는 긍정 및 중립 클래스의 재현율과 F1 점수에서 가장 안정적인 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.