Skip to main content
QUICK REVIEW

[论文解读] Identifying Data Noises, User Biases, and System Errors in Geo-tagged Twitter Messages (Tweets)

Ming‐Hsiang Tsou, Hao Zhang|arXiv (Cornell University)|Dec 6, 2017
Complex Network Analysis Techniques参考文献 12被引用 15
一句话总结

本文通过元数据分析与空间验证,识别并量化了来自 Twitter Streaming API 的地理标记推文中的数据噪声、用户偏见与系统错误。研究发现,圣迭戈市 29.42% 的地理标记推文以及哥伦布市 53.47% 的地理标记推文为垃圾信息、机器人或网络化身账号,且超过一半(57.3%)的推文位于 API 指定的边界框之外,凸显了空间分析中存在严重的数据质量问题。

ABSTRACT

Many social media researchers and data scientists collected geo-tagged tweets to conduct spatial analysis or identify spatiotemporal patterns of filtered messages for specific topics or events. This paper provides a systematic view to illustrate the characteristics (data noises, user biases, and system errors) of geo-tagged tweets from the Twitter Streaming API. First, we found that a small percentage (1%) of active Twitter users can create a large portion (16%) of geo-tagged tweets. Second, there is a significant amount (57.3%) of geo-tagged tweets located outside the Twitter Streaming API's bounding box in San Diego. Third, we can detect spam, bot, cyborg tweets (data noises) by examining the "source" metadata field. The portion of data noises in geo-tagged tweets is significant (29.42% in San Diego, CA and 53.47% in Columbus, OH) in our case study. Finally, the majority of geo-tagged tweets are not created by the generic Twitter apps in Android or iPhone devices, but by other platforms, such as Instagram and Foursquare. We recommend a multi-step procedure to remove these noises for the future research projects utilizing geo-tagged tweets.

研究动机与目标

  • 系统性地表征来自 Twitter Streaming API 的地理标记推文中存在的数据质量问题——包括数据噪声、用户偏见与系统错误。
  • 利用元数据字段量化垃圾信息、机器人及网络化身账号在地理标记推文中的普遍程度。
  • 通过将推文位置与 API 指定的边界框进行对比,评估地理标记推文的空间准确性。
  • 识别除原生移动应用外,主要生成地理标记推文的平台。
  • 提出一个多步骤的数据清洗流程,以提升未来使用 Twitter 数据进行空间与时间分析的可靠性。

提出的方法

  • 分析地理标记推文的 'source' 元数据字段,以检测垃圾信息、机器人及网络化身账号活动。
  • 通过与 Twitter Streaming API 在圣迭戈市预设的边界框对比,验证推文位置,识别空间异常值。
  • 利用平台特定的源标识符,计算源自非原生 Twitter 应用(如 Instagram、Foursquare)的地理标记推文占比。
  • 通过识别贡献了前 1% 最活跃用户推文的占比,衡量用户活动集中度。
  • 应用空间聚类与统计分析,评估地理标记推文分布相对于 API 地理范围的分布特征。
  • 提出一个多步骤的数据清洗流程,以在空间分析前过滤掉数据噪声与系统错误。

实验结果

研究问题

  • RQ1在 Twitter Streaming API 的地理标记推文中,由极少数高度活跃用户生成的比例是多少?
  • RQ2根据 'source' 元数据字段,垃圾信息、机器人或网络化身账号活动在地理标记推文中的显著程度如何?
  • RQ3在多大程度上,地理标记推文位于 API 指定的边界框之外,表明存在系统错误或配置错误?
  • RQ4哪些平台(如 Instagram、Foursquare)是地理标记推文的主要来源,而非原生 Twitter 应用?
  • RQ5可应用哪些系统性的数据清洗流程,以提升地理标记 Twitter 数据在空间分析中的可靠性?

主要发现

  • 仅 1% 的活跃 Twitter 用户生成了全部地理标记推文中的 16%,表明用户活动存在极端集中现象。
  • 圣迭戈市 57.3% 的地理标记推文位于 Twitter Streaming API 指定边界框之外,表明存在显著的系统级空间错误。
  • 通过 'source' 元数据字段检测到,数据噪声(垃圾信息机器人、机器人及网络化身账号)占圣迭戈市地理标记推文的 29.42%,占俄亥俄州哥伦布市的 53.47%。
  • 大多数地理标记推文并非由原生 iOS 或 Android Twitter 应用创建,而是由第三方平台(如 Instagram 和 Foursquare)生成。
  • 大量地理标记推文源自非 Twitter 应用,引发对数据来源与可靠性的担忧。
  • 本研究建议采用多步骤数据清洗流程,以过滤数据噪声与空间异常值,从而提升未来空间分析项目的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。