Skip to main content
QUICK REVIEW

[논문 리뷰] Sentiment Analysis on IMDB Movie Comments and Twitter Data by Machine Learning and Vector Space Techniques

İlhan Tarımer, Adil Çoban|arXiv (Cornell University)|2019. 03. 18.
Advanced Text Analysis Techniques참고 문헌 12인용 수 6
한 줄 요약

이 연구는 KNIME Analytics 플랫폼을 통해 IMDB 영화 댓글(2,000개 샘플)과 트위터 데이터(3,200개 샘플)에 기계 학습 및 벡터 공간 기법을 사용한 감성 분석 모델을 제안한다. 의사결정나무, 나이브 베이즈, 서포트 벡터 머신(SVM) 분류기를 평가한 결과, SVM는 IMDB에서 85.50%의 최고 정확도를 기록했고, 트위터 데이터에서는 72.50%의 정확도를 기록하여 두 데이터셋에서 다른 알고리즘보다 뛰어난 성능을 보였다.

ABSTRACT

This study's goal is to create a model of sentiment analysis on a 2000 rows IMDB movie comments and 3200 Twitter data by using machine learning and vector space techniques; positive or negative preliminary information about the text is to provide. In the study, a vector space was created in the KNIME Analytics platform, and a classification study was performed on this vector space by Decision Trees, Naïve Bayes and Support Vector Machines classification algorithms. The conclusions obtained were compared in terms of each algorithms. The classification results for IMDB movie comments are obtained as 94,00%, 73,20%, and 85,50% by Decision Tree, Naive Bayes and SVM algorithms. The classification results for Twitter data set are presented as 82,76%, 75,44% and 72,50% by Decision Tree, Naive Bayes SVM algorithms as well. It is seen that the best classification results presented in both data sets are which calculated by SVM algorithm.

연구 동기 및 목표

  • 기계 학습 및 벡터 공간 기법을 사용하여 영화 리뷰와 소셜 미디어 텍스트의 감성 분류 모델을 개발하기 위해.
  • 감성 분류 작업에서 의사결정나무, 나이브 베이즈, 서포트 벡터 머신의 성능을 비교하기 위해.
  • IMDB 영화 댓글과 트위터 데이터라는 두 가지 다른 텍스트 데이터셋에 대한 모델 효과성을 평가하기 위해.
  • 주어진 맥락에서 감성 분석에 최적의 알고리즘과 벡터 표현 전략을 식별하기 위해.
  • 실세계 텍스트 데이터에서 다양한 기계 학습 모델의 분류 정확도를 비교 분석하기 위해.

제안 방법

  • IMDB 영화 댓글과 트위터 텍스트 데이터에서 수집한 텍스트 자료를 사용하여 벡터 공간 표현을 구축하였으며, KNIME Analytics 플랫폼에서 처리하였다.
  • 텍스트 전처리 과정으로 토큰화와 특징 추출을 수행하여 원시 텍스트를 분류에 적합한 수치형 벡터로 변환하였다.
  • 세 가지 분류기—의사결정나무, 나이브 베이즈, 서포트 벡터 머신—을 벡터화된 데이터에 대해 학습하고 평가하였다.
  • 모델 성능은 분류 정확도를 측정 기준으로 삼아 알고리즘과 데이터셋 간 비교를 수행하였다.
  • 일관된 평가를 위해 모든 실험은 고정된 데이터셋 크기(2,000개의 IMDB 댓글, 3,200개의 트위터 샘플)를 사용하였다.
  • 모든 실험은 KNIME Analytics 플랫폼 내에서 수행되었으며, 통합된 기계 학습 및 데이터 전처리 도구를 활용하였다.

실험 결과

연구 질문

  • RQ1IMDB 영화 댓글 데이터에서 어떤 기계 학습 알고리즘이 가장 높은 감성 분류 정확도를 달성하는가?
  • RQ2의사결정나무, 나이브 베이즈, SVM는 트위터 감성 분석 작업에서 어떻게 성능을 내는가?
  • RQ3SVM 알고리즘이 IMDB와 트위터 데이터셋 모두에서 다른 분류기보다 일관되게 뛰어난 성능을 내는가?
  • RQ4이 설정에서 벡터 공간 표현은 감성 분류 성능에 어떤 영향을 미치는가?
  • RQ5구조화된 영화 리뷰와 비공식적인 소셜 미디어 텍스트 간 결과는 어떻게 다름?

주요 결과

  • SVM 분류기는 IMDB 영화 댓글 데이터셋에서 85.50%의 최고 정확도를 기록하여 의사결정나무(94.00%)와 나이브 베이즈(73.20%)를 모두 앞섰다.
  • 트위터 데이터셋에서는 SVM가 72.50%의 정확도를 기록하여 의사결정나무(82.76%)에 이어 두 번째로 높았고, 나이브 베이즈(75.44%)보다 앞섰다.
  • 낮은 총합 정확도에도 불구하고, 나이브 베이즈는 두 데이터셋 모두에서 일관된 성능을 보여, 데이터 분포의 차이에 대해 뛰어난 내성성을 지닌 것으로 나타났다.
  • 의사결정나무는 트위터 데이터에서 가장 높은 정확도(82.76%)를 기록하여, 고도로 변동성이 큰 비공식적인 텍스트에 적합한 것으로 나타났다.
  • 결과적으로, SVM는 IMDB 데이터에서 감성 분석에 가장 효과적인 모델이며, 트위터 데이터에서는 의사결정나무가 가장 뛰어난 성능을 보였다.
  • 전반적으로, SVM는 특히 더 공식적인 IMDB 댓글에서 가장 균형 잡히고 높은 성능을 보여, 두 데이터셋 모두에서 가장 우수한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.