Skip to main content
QUICK REVIEW

[論文レビュー] Using Hadoop for Large Scale Analysis on Twitter: A Technical Report

Nikolaos Nodarakis, Spyros Sioutas|arXiv (Cornell University)|Feb 3, 2016
Sentiment Analysis and Opinion Mining参考文献 24被引用数 11
ひとこと要約

この論文では、HadoopのMapReduceモデルに基づき、ハッシュタグと絵文字を自動的なセンチメントラベルとして活用することで、分散並列的にツイートのセンチメントを分類するスケーラブルなセンチメント分析フレームワークMR-SATを提案する。特徴ベクトルの圧縮にブルームフィルタを統合することで、ストレージを15–20%削減し、I/O効率を向上させ、実行速度の向上と大規模なTwitterデータセットにおける線形スケーラビリティを実現した。分類精度は高い水準を維持した。

ABSTRACT

Sentiment analysis (or opinion mining) on Twitter data has attracted much attention recently. One of the system's key features, is the immediacy in communication with other users in an easy, user-friendly and fast way. Consequently, people tend to express their feelings freely, which makes Twitter an ideal source for accumulating a vast amount of opinions towards a wide diversity of topics. This amount of information offers huge potential and can be harnessed to receive the sentiment tendency towards these topics. However, since none can invest an infinite amount of time to read through these tweets, an automated decision making approach is necessary. Nevertheless, most existing solutions are limited in centralized environments only. Thus, they can only process at most a few thousand tweets. Such a sample, is not representative to define the sentiment polarity towards a topic due to the massive number of tweets published daily. In this paper, we go one step further and develop a novel method for sentiment learning in the MapReduce framework. Our algorithm exploits the hashtags and emoticons inside a tweet, as sentiment labels, and proceeds to a classification procedure of diverse sentiment types in a parallel and distributed manner. Moreover, we utilize Bloom filters to compact the storage size of intermediate data and boost the performance of our algorithm. Through an extensive experimental evaluation, we prove that our solution is efficient, robust and scalable and confirm the quality of our sentiment identification.

研究の動機と目的

  • 数えきれないほどのツイート(数万件程度)しか処理できない集中型センチメント分析システムのスケーラビリティ制限を解消すること。
  • HadoopのMapReduceフレームワークを活用することで、Twitterにおける大規模で分散型のセンチメント分析を可能にすること。
  • 分類性能を損なわせることなく、特徴ベクトル表現におけるストレージとI/Oのオーバーヘッドをブルームフィルタを用いて低減すること。
  • 大規模なTwitterデータセットにおいて、バイナリ分類およびマルチクラス分類の両方で高い精度とスケーラビリティを達成すること。
  • ビッグデータにおけるリアルタイムセンチメント分析に耐えうる、強固で効率的かつ拡張性のあるフレームワークを提供すること。

提案手法

  • 自動センチメントラベルとしてハッシュタグと絵文字を活用することで、手動アノテーションを排除し、大規模な学習データの生成を可能にする。
  • ツイートの内容から高次元の特徴ベクトルを構築し、単語頻度とTF-IDF重み付けを用いてテクスト特徴を表現する。
  • ブルームフィルタを用いて特徴集合を効率的に表現することで、MapReduce処理中のストレージとI/Oコストを削減する。
  • ハッシュタグと絵文字から得られるラベル付きツイートデータを学習に用いた機械学習モデルを用いて、バイナリおよびマルチクラス分類を実行する。
  • Hadoop上で実装され、水平スケーラビリティを実現するため、MapReduceパラダイムを活用して計算をクラスタに分散処理する。
  • 動的データパーティショニングをサポートし、さまざまなデータサイズおよび特徴集合次元数における性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1MapReduceベースのシステムは、大規模なTwitterデータに対してセンチメント分析で線形スケーラビリティを達成できるか?
  • RQ2ハッシュタグと絵文字を自動センチメントラベルとして用いることは、センチメント分類器の学習にどの程度有効か?
  • RQ3ブルームフィルタは、センチメント分析における特徴ベクトル表現において、ストレージをどの程度削減し、性能をどの程度向上させるか?
  • RQ4ブルームフィルタにおけるハッシュ関数の数kの選択が、バイナリおよびマルチクラス設定における分類精度に与える影響はいかほどか?
  • RQ5分散センチメント分析パイプラインでブルームフィルタを使用する場合、前処理時間と実行時間のトレードオフはどのようなものか?

主な発見

  • ブルームフィルタの使用により、すべての実験的設定で特徴ベクトルのストレージサイズが15–20%削減され、I/Oオーバーヘッドが顕著に低減した。
  • 誤検出が発生しても、ブルームフィルタは高い分類性能を維持した。バイナリおよびマルチクラス設定の両方で、k値の変化に関わらず調和Fスコアが安定した。
  • ブルームフィルタを用いない場合、k値の増加により性能が向上した(特にバイナリ分類で顕著)。これはブルームフィルタが高k値の必要性を緩和することを示している。
  • システムはほぼ線形スケーリングを示した。元のデータセットの0.2から0.8の範囲でデータサイズが増加した際、実行時間も比例的に増加した。これは強力なスケーラビリティを裏付けた。
  • ブルームフィルタはI/Oを削減することで実行時間をわずかに改善したが、マルチクラス絵文字分類ではその恩恵は限定的だった。
  • フレームワークは高い調和Fスコア(バイナリ絵文字分類で最大0.79、マルチクラス絵文字分類で0.60)を達成し、優れた分類性能を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。