[論文レビュー] Identifying Data Noises, User Biases, and System Errors in Geo-tagged Twitter Messages (Tweets)
本研究は、TwitterのStreaming APIから得た位置タグ付きツイートにおけるデータノイズ、ユーザーバイアス、システムエラーを、メタデータ分析と空間的妥当性検証を用いて同定および定量する。サンディエゴでは29.42%、コロンバスでは53.47%の位置タグ付きツイートがスパム、ボット、またはサイボーグであることが判明し、57.3%がAPIが指定した境界ボックスの外にあることが判明しており、空間的分析における顕著なデータ品質問題を示している。
Many social media researchers and data scientists collected geo-tagged tweets to conduct spatial analysis or identify spatiotemporal patterns of filtered messages for specific topics or events. This paper provides a systematic view to illustrate the characteristics (data noises, user biases, and system errors) of geo-tagged tweets from the Twitter Streaming API. First, we found that a small percentage (1%) of active Twitter users can create a large portion (16%) of geo-tagged tweets. Second, there is a significant amount (57.3%) of geo-tagged tweets located outside the Twitter Streaming API's bounding box in San Diego. Third, we can detect spam, bot, cyborg tweets (data noises) by examining the "source" metadata field. The portion of data noises in geo-tagged tweets is significant (29.42% in San Diego, CA and 53.47% in Columbus, OH) in our case study. Finally, the majority of geo-tagged tweets are not created by the generic Twitter apps in Android or iPhone devices, but by other platforms, such as Instagram and Foursquare. We recommend a multi-step procedure to remove these noises for the future research projects utilizing geo-tagged tweets.
研究の動機と目的
- TwitterのStreaming APIから得た位置タグ付きツイートにおけるデータ品質の問題—データノイズ、ユーザーバイアス、システムエラー—を体系的に特徴づけること。
- メタデータフィールドを用いて、スパム、ボット、サイボーグ活動の割合を定量すること。
- APIが指定した境界ボックスとの比較により、位置タグ付きツイートの空間的正確性を評価すること。
- ネイティブのモバイルアプリ以外の主なプラットフォームが、位置タグ付きツイートをどの程度生成しているかを特定すること。
- 今後の空間的および時間的分析に用いるTwitterデータの信頼性を向上させるための複数段階のデータクリーニング手順を提言すること。
提案手法
- スパム、ボット、サイボーグ活動の検出のため、位置タグ付きツイートの'metadata'フィールドの'source'を分析すること。
- サンディエゴのTwitter Streaming APIが定めた境界ボックスに対してツイートの位置を検証し、空間的外れのデータを同定すること。
- プラットフォーム固有の'source'識別子を用いて、ネイティブのTwitterアプリ以外(例:Instagram、Foursquare)から発信された位置タグ付きツイートの割合を計算すること。
- 上位1%の活発ユーザーが発信したツイートの割合を特定することで、ユーザーアクティビティの集中度を測定すること。
- 空間クラスタリングおよび統計的分析を適用し、位置タグ付きツイートの分布がAPIの地理的範囲内にどのように分布しているかを評価すること。
- データノイズおよびシステムエラーを除外するための複数段階のデータクリーニングパイプラインを提言すること。
実験結果
リサーチクエスチョン
- RQ1TwitterのStreaming APIにおける位置タグ付きツイートのうち、わずか少数の活発ユーザーが発信している割合はどの程度か?
- RQ2スパム、ボット、またはサイボーグ活動の存在は、'source'メタデータフィールドによってどの程度顕著に現れるか?
- RQ3位置タグ付きツイートのどの程度が、APIが指定した境界ボックスの外にあるか。これは、システムエラーまたは誤設定を示唆するか?
- RQ4InstagramやFoursquareなどのプラットフォームは、ネイティブのTwitterアプリとは異なり、位置タグ付きツイートの主な発信元であるか?
- RQ5位置タグ付きTwitterデータの信頼性を向上させるために、どのような体系的なデータクリーニング手順を適用できるか?
主な発見
- わずか1%の活発ユーザーが、すべての位置タグ付きツイートの16%を発信しており、ユーザーアクティビティの極端な集中が示唆される。
- サンディエゴの位置タグ付きツイートの57.3%が、Twitter Streaming APIが指定した境界ボックスの外に位置しており、顕著なシステムレベルの空間的エラーを示している。
- データノイズ(スパムボット、ボット、サイボーグ)は、サンディエゴで位置タグ付きツイートの29.42%、オハイオ州コロンバスで53.47%を占めており、'source'メタデータフィールドによる検出結果である。
- 位置タグ付きツイートの大多数は、ネイティブのiOSまたはAndroid Twitterアプリから発信されているのではなく、Instagram や Foursquare などのサードパーティプラットフォームから発信されている。
- 位置タグ付きツイートの大部分は、Twitter以外のアプリケーションから発信されており、データの出所および信頼性に関する懸念を呈している。
- 本研究は、今後の空間的分析プロジェクトにおける正確性を向上させるために、データノイズおよび空間的外れのデータを除外するための複数段階のデータクリーニング手順を提言している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。