Skip to main content
QUICK REVIEW

[論文レビュー] Is the Sample Good Enough? Comparing Data from Twitter's Streaming API with Twitter's Firehose

Fred Morstatter, Jürgen Pfeffer|arXiv (Cornell University)|Jun 21, 2013
Complex Network Analysis Techniques被引用数 6
ひとこと要約

本稿は、複数の次元にわたり、全Firehoseデータセットと比較して、TwitterのStreaming APIの代表性を評価する。カバレッジが高ければ、大規模なハッシュタグやトピック分析においては妥当な性能を示すが、小規模なサンプル状況ではバイアスを生じ、特にネットワークや中心性指標においてランダムサンプリングを下回る。一方、空間フィルタリングのおかげで、地理的にタグ付けされたデータはほぼ完全に捉えられている。

ABSTRACT

Twitter is a social media giant famous for the exchange of short, 140-character messages called "tweets". In the scientific community, the microblogging site is known for openness in sharing its data. It provides a glance into its millions of users and billions of tweets through a "Streaming API" which provides a sample of all tweets matching some parameters preset by the API user. The API service has been used by many researchers, companies, and governmental institutions that want to extract knowledge in accordance with a diverse array of questions pertaining to social media. The essential drawback of the Twitter API is the lack of documentation concerning what and how much data users get. This leads researchers to question whether the sampled data is a valid representation of the overall activity on Twitter. In this work we embark on answering this question by comparing data collected using Twitter's sampled API service with data collected using the full, albeit costly, Firehose stream that includes every single published tweet. We compare both datasets using common statistical metrics as well as metrics that allow us to compare topics, networks, and locations of tweets. The results of our work will help researchers and practitioners understand the implications of using the Streaming API.

研究の動機と目的

  • TwitterのStreaming APIが、全体のTwitter活動を統計的に代表するサンプルを提供するかどうかを評価すること。
  • サンプリングバイアスが、トピックモデリング、ネットワーク分析、地理的分布といった一般的な分析タスクに与える影響を評価すること。
  • Streaming APIの結果を、Firehoseからのランダムサンプルおよび全Firehoseと比較し、サンプリングメカニズムに起因するバイアスを特定すること。
  • 研究者が、自信をもってStreaming APIを使用できる状況と方法について、実証的指針を提供すること。
  • さまざまなパrameterセットと条件下での、Streaming APIの実際のデータカバレッジを推定すること。

提案手法

  • 同じパrameterを用いて、Streaming APIおよびTwitter Firehoseから並列のデータセットを収集する。
  • Streaming APIとFirehoseデータの間で、上位n個のハッシュタグの相関係数を比較する。
  • Latent Dirichlet Allocation (LDA)を用いて、データセット間のトピック分布を抽出・比較する。
  • 両方のデータセットからユーザ間のリツイートネットワークを構築し、上位100名のキーパーソンおよびネットワーク中央性指標を比較する。
  • 大陸および空間的地域ごとの地理的にタグ付けされたツイートの分布を分析し、場所ベースの分析におけるサンプリングバイアスを評価する。
  • Streaming APIの結果を、Firehoseから抽出した100個のランダムサンプルデータセットと比較し、統計的頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1Streaming APIは、Firehoseと比較して、ハッシュタグの全分布をどの程度適切に代表しているか?
  • RQ2全データセットと比較して、Streaming APIはどの程度、トピック分布を適切に保持しているか?
  • RQ3リツイートネットワークにおけるネットワーク中心性指標およびキーパーソン同定は、Streaming APIデータからどの程度正確に回復できるか?
  • RQ4Streaming APIとFirehoseの間で、地理的にタグ付けされたツイートの分布はどの程度類似しているか?
  • RQ5主な分析タスクにおいて、Streaming APIはFirehoseからのランダムサンプリングよりも優れているか、それとも劣っているか?

主な発見

  • Streaming APIのカバレッジは、一致するツイート数が増えるにつれて著しく低下し、カバレッジが低い状況では性能が著しく低下する。
  • 上位ハッシュタグ分析においては、nが小さい場合、Streaming APIはFirehoseと負の相関を示すが、ランダムサンプリングは高い正の相関を維持する。
  • LDAを用いたトピックモデリングでは、FirehoseからのランダムサンプルがStreaming APIデータよりも顕著に高い精度を示し、特にカバレッジが低い状況で顕著である。
  • 平均して、1日分のデータから、Streaming APIはリツイートネットワークにおける上位100名のキーパーソンの50–60%を回復する。複数日分のデータを集約することで性能が向上する。
  • ネットワーク中央性インデックスは、Streaming APIがカバーするデータの割合と強く相関しており、ネットワーク構造に系統的なバイアスが存在することが示唆される。
  • サンプリングの影響にもかかわらず、地理的ボーディングボックスを用いることで、Streaming APIは地理的にタグ付けされたツイートのほぼすべてを捉えている。これは空間フィルタリング効果によるものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。