Skip to main content
QUICK REVIEW

[论文解读] On Identifying Disaster-Related Tweets: Matching-based or Learning-based?

Hien To, Sumeet Agrawal|arXiv (Cornell University)|May 4, 2017
Public Relations and Crisis Communication参考文献 27被引用 9
一句话总结

本文提出了一种改进的基于匹配的方法,通过使用核心关键词和众包优化的标签匹配来扩展关键词和标签匹配,以识别与灾难相关的推文,相比基于学习的方法,实现了更高品质、更具可解释性的结果。在11个灾难数据集上,基于匹配的方法在召回率和情感分析质量方面优于基于学习的技术,尤其是在灾难高峰期捕捉及时、相关消息方面表现更优。

ABSTRACT

Social media such as tweets are emerging as platforms contributing to situational awareness during disasters. Information shared on Twitter by both affected population (e.g., requesting assistance, warning) and those outside the impact zone (e.g., providing assistance) would help first responders, decision makers, and the public to understand the situation first-hand. Effective use of such information requires timely selection and analysis of tweets that are relevant to a particular disaster. Even though abundant tweets are promising as a data source, it is challenging to automatically identify relevant messages since tweet are short and unstructured, resulting to unsatisfactory classification performance of conventional learning-based approaches. Thus, we propose a simple yet effective algorithm to identify relevant messages based on matching keywords and hashtags, and provide a comparison between matching-based and learning-based approaches. To evaluate the two approaches, we put them into a framework specifically proposed for analyzing disaster-related tweets. Analysis results on eleven datasets with various disaster types show that our technique provides relevant tweets of higher quality and more interpretable results of sentiment analysis tasks when compared to learning approach.

研究动机与目标

  • 为解决在简短、非正式的社交媒体消息中识别相关灾难推文的挑战。
  • 比较基于匹配和基于学习的方法在分类灾难相关推文方面的有效性。
  • 通过核心关键词匹配和众包方式扩展相关标签,提升灾难推文识别的召回率和质量。
  • 创建并公开发布11个新的、带有地理标签的灾难推文数据集,供公众研究使用。
  • 证明基于匹配的方法相比基于学习的模型能产生更具可解释性的情感分析结果。

提出的方法

  • 该方法为每种灾难类型(例如,'earthquake','flood')预定义一组核心关键词,用于匹配推文。
  • 通过将推文语料库中的标签与核心关键词匹配,自动提取候选标签。
  • 通过众包方式对候选标签进行优化,去除无关标签,从而提高精确率。
  • 最终使用核心关键词和优化后的标签集合来匹配并检索与灾难相关的推文。
  • 一种互补的基于学习的方法使用word2vec、TF-IDF、LSI和逻辑回归对推文进行分类。
  • 该框架以召回率为首要指标评估两种方法,将每种方法的输出作为交叉评估的基准。

实验结果

研究问题

  • RQ1在召回率和结果质量方面,基于匹配和基于学习的方法在识别灾难相关推文方面有何差异?
  • RQ2通过扩展相关标签集合,能在多大程度上提升基于匹配的推文识别召回率?
  • RQ3垃圾推文的存在在多大程度上影响了灾难相关推文情感分析的可靠性?
  • RQ4基于匹配的方法是否能产生比基于学习的模型更具可解释性的情感分析结果?
  • RQ5两种方法在不同灾难类型(例如,地震、洪水、野火)上的表现有何差异?

主要发现

  • 在全部11个灾难数据集上,基于匹配的方法均获得了比基于学习的方法更高的召回率,表明其在识别相关推文方面表现更优。
  • 改进后的基于匹配的方法相比传统匹配方法,使相关推文数量最多提升了80%。
  • 基于学习的方法引入了更高比例的无关推文,导致情感分析结果失真,掩盖了真实灾难影响趋势。
  • 在去除垃圾推文后,情感分析中正面和负面推文的数量更加准确,并与实际灾难事件的时间分布更加一致。
  • 在纽约风暴数据集中,第10天观察到的情感异常峰值是由50名活跃垃圾发送者大规模发布相同内容造成的。
  • 基于匹配的方法产生了更具可解释性的情感地图,清晰显示了灾难高峰期负面情绪的显著上升,而基于学习的方法则未能呈现这一趋势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。