Skip to main content
QUICK REVIEW

[論文レビュー] Sentiment analysis on electricity twitter posts

Pardeep Kaur, Maryam Edalati|arXiv (Cornell University)|Jun 10, 2022
Sentiment Analysis and Opinion Mining被引用数 6
ひとこと要約

本研究では、英国およびインドにおける電力料金の上昇に関する約10,000件の英語圏のTwitter投稿を対象に、TF-IDF特徴抽出法と複数の機械学習分類器を用いた感情分析を実施した。ランダムフォレストが最も高い正答率(84%)を達成し、ナイーブベイズ(66%)を上回り、TF-IDFの単語レベル特徴量がn-gram特徴量よりも優れた性能を示した。

ABSTRACT

In today's world, everyone is expressive in some way, and the focus of this project is on people's opinions about rising electricity prices in United Kingdom and India using data from Twitter, a micro-blogging platform on which people post messages, known as tweets. Because many people's incomes are not good and they have to pay so many taxes and bills, maintaining a home has become a disputed issue these days. Despite the fact that Government offered subsidy schemes to compensate people electricity bills but it is not welcomed by people. In this project, the aim is to perform sentiment analysis on people's expressions and opinions expressed on Twitter. In order to grasp the electricity prices opinion, it is necessary to carry out sentiment analysis for the government and consumers in energy market. Furthermore, text present on these medias are unstructured in nature, so to process them we firstly need to pre-process the data. There are so many feature extraction techniques such as Bag of Words, TF-IDF (Term Frequency-Inverse Document Frequency), word embedding, NLP based features like word count. In this project, we analysed the impact of feature TF-IDF word level on electricity bills dataset of sentiment analysis. We found that by using TF-IDF word level performance of sentiment analysis is 3-4 higher than using N-gram features. Analysis is done using four classification algorithms including Naive Bayes, Decision Tree, Random Forest, and Logistic Regression and considering F-Score, Accuracy, Precision, and Recall performance parameters.

研究の動機と目的

  • 英国およびインドのTwitterデータを用いて、電力料金上昇に対する一般世論の感情を分析すること。
  • 具体的には、TF-IDFの単語レベル特徴量とn-gram特徴量を比較し、感情分類性能に与える影響を評価すること。
  • ナイーブベイズ、意思決定木、ランダムフォレスト、ロジスティック回帰といった複数の機械学習分類器の性能を、感情分類タスクにおいて比較すること。
  • 政府およびエネルギー市場関係者による政策意思決定に役立てるため、エネルギー料金上昇に対する世論と政策反応の洞察を提供すること。

提案手法

  • Pythonを用いてTwitter APIを介し、電力料金上昇に関連する約10,000件の英語のツイートを収集した。
  • トークン化やストップワードの除去を含む標準的な自然言語処理技術を用いて、テキストデータを前処理した。
  • 単語レベルのTF-IDF(項目の頻度・逆文書頻度)を用いて特徴量を抽出し、n-gram特徴量と比較した。
  • 感情極性予測のため、ナイーブベイズ、意思決定木、ランダムフォレスト、ロジスティック回帰の4つの分類アルゴリズムを適用した。
  • Fスコア、正答率、適合率、再現率といった標準的な指標を用いてモデルを評価した。
  • モデルの分離性と全体的な性能を評価するため、ROC曲線とAUCスコアを生成した。

実験結果

リサーチクエスチョン

  • RQ1電力料金関連のツイートにおける感情分類性能において、TF-IDFの単語レベル特徴量とn-gram特徴量のどちらが優れているか?
  • RQ2ナイーブベイズ、意思決定木、ランダムフォレスト、ロジスティック回帰といった異なる機械学習モデルは、電力料金関連のTwitterデータにおける感情分類においてどのように性能を発揮するか?
  • RQ3英国およびインドの多言語的で現実世界の電力料金関連ツイートデータセットを対象とした感情分類モデルの全体的な正答率とFスコアは何か?
  • RQ4本研究の文脈において、TF-IDF特徴量は他の特徴セットと比較して、感情分類性能をどの程度向上させるか?

主な発見

  • ランダムフォレストが84%の最高正答率を記録し、ナイーブベイズ(66%)を顕著に上回った。
  • TF-IDFの単語レベル特徴量は、n-gram特徴量と比較して、感情分類性能で3〜4%の向上を示した。
  • 意思決定木とランダムフォレストは、陽性感情を分類する際の適合率が最も高く、信頼性の高さを示した。
  • ランダムフォレストとロジスティック回帰は、再現率が最も高く、実際に陽性の感情を正しく検出できたことを示した。
  • 全モデルのAUCスコアは良好な分離性を示しており、意思決定木とランダムフォレストでは0.7以上の値を記録し、強力なモデル識別能力を裏付けた。
  • データセットのサイズや言語範囲の制限にもかかわらず、モデルは高い性能を示した。特に、ランダムフォレストが本タスクにおいて最も効果的な分類器であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。