Skip to main content
QUICK REVIEW

[論文レビュー] Sentiment Analysis on IMDB Movie Comments and Twitter Data by Machine Learning and Vector Space Techniques

İlhan Tarımer, Adil Çoban|arXiv (Cornell University)|Mar 18, 2019
Advanced Text Analysis Techniques参考文献 12被引用数 6
ひとこと要約

本研究では、KNIME Analyticsプラットフォームを用いて、IMDB映画レビューのコメント(2,000件)とTwitterデータ(3,200件)のテキストに対して機械学習およびベクトル空間技術を用いた感情分析モデルを提案する。決定木、ナイーブベイズ、SVMの分類器を評価した結果、SVMはIMDBデータで85.50%、Twitterデータで72.50%の最高精度を達成し、両データセットにおいて他のアルゴリズムを上回った。

ABSTRACT

This study's goal is to create a model of sentiment analysis on a 2000 rows IMDB movie comments and 3200 Twitter data by using machine learning and vector space techniques; positive or negative preliminary information about the text is to provide. In the study, a vector space was created in the KNIME Analytics platform, and a classification study was performed on this vector space by Decision Trees, Naïve Bayes and Support Vector Machines classification algorithms. The conclusions obtained were compared in terms of each algorithms. The classification results for IMDB movie comments are obtained as 94,00%, 73,20%, and 85,50% by Decision Tree, Naive Bayes and SVM algorithms. The classification results for Twitter data set are presented as 82,76%, 75,44% and 72,50% by Decision Tree, Naive Bayes SVM algorithms as well. It is seen that the best classification results presented in both data sets are which calculated by SVM algorithm.

研究の動機と目的

  • 機械学習およびベクトル空間技術を用いて、映画レビューおよびソーシャルメディアのテキストの感情分類モデルを開発すること。
  • 感情分類タスクにおける決定木、ナイーブベイズ、サポートベクターマシンの性能を比較すること。
  • 2つの異なるテキストデータセット(IMDB映画レビューのコメントとTwitterデータ)におけるモデルの有効性を評価すること。
  • 本研究の文脈において、感情分析の最適なアルゴリズムおよびベクトル表現戦略を特定すること。
  • 実世界のテキストデータにおける、さまざまな機械学習モデルの分類精度を比較分析すること。

提案手法

  • ベクトル空間表現は、IMDB映画レビューのコメントおよびTwitterのテキストデータをKNIME Analyticsプラットフォームで処理して構築された。
  • テキスト前処理にはトークン化と特徴抽出が含まれ、生テキストを分類に適した数値ベクトルに変換した。
  • 3つの分類器(決定木、ナイーブベイズ、サポートベクターマシン)がベクトル化されたデータ上で学習および評価された。
  • モデルの性能は分類精度を指標として測られ、アルゴリズムおよびデータセットごとに結果を比較した。
  • 一貫性のある評価を確保するため、IMDBコメントは2,000件、Twitterサンプルは3,200件の固定データサイズが使用された。
  • すべての実験はKNIME Analyticsプラットフォーム内で実施され、統合された機械学習およびデータ前処理ツールが活用された。

実験結果

リサーチクエスチョン

  • RQ1どの機械学習アルゴリズムがIMDB映画レビューのコメントデータで最高の感情分類精度を達成するか?
  • RQ2決定木、ナイーブベイズ、SVMは、Twitterの感情分析タスクでどのように性能を発揮するか?
  • RQ3SVMアルゴリズムは、IMDBおよびTwitterの両データセットで一貫して他の分類器を上回る性能を示すか?
  • RQ4この設定におけるベクトル空間表現が、感情分類性能に与える影響は何か?
  • RQ5構造的で明確な映画レビューと、非公式で自由なソーシャルメディアのテキストの間で、結果にどのような差が生じるか?

主な発見

  • SVM分類器は、IMDB映画レビューのコメントデータセットで85.50%の最高精度を達成し、決定木(94.00%)およびナイーブベイズ(73.20%)を上回った。
  • Twitterデータでは、SVMが72.50%の精度を記録し、決定木(82.76%)に次いで2位にランクされたが、ナイーブベイズ(75.44%)を上回った。
  • 全体的な精度が低くても、ナイーブベイズは両データセットで一貫した性能を示し、データ分布の違いに対して高い耐性を示した。
  • 決定木は、語彙的多様性の高い短い非公式なテキストに適している可能性を示し、Twitterデータで最高の精度(82.76%)を達成した。
  • 結果から、SVMはIMDBデータの感情分析において最も効果的なモデルであることが示された一方で、決定木はTwitterデータで最も優れた性能を発揮した。
  • 全体的に見て、SVMは両データセットにおいてバランスが取れており、特に形式的で明確なIMDBのコメントに対して最高の性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。