Skip to main content
QUICK REVIEW

[论文解读] Extracting COVID-19 Events from Twitter

Shi Zong, Ashutosh Baheti|arXiv (Cornell University)|Jun 3, 2020
Misinformation and Its Impacts参考文献 9被引用 22
一句话总结

本文介绍了一个手动标注的语料库,包含7,500条Twitter推文,其中标注了诸如确诊结果和无法获得检测等COVID-19事件。利用该语料库,作者展示了通过槽填充实现事件提及的高效自动抽取,从而实现对自报疫情相关经历的结构化表示,相关工具和数据已公开提供。

ABSTRACT

We present a corpus of 7,500 tweets annotated with COVID-19 events, including positive test results, denied access to testing, and more. We show that our corpus enables automatic identification of COVID-19 events mentioned in Twitter with text spans that fill a set of pre-defined slots for each event. We also present analyses on the self-reporting cases and user's demographic information. We will make our annotated corpus and extraction tools available for the research community to use upon publication at this https URL

研究动机与目标

  • 创建一个高质量的、手动标注的Twitter帖子语料库,用于报告与COVID-19相关的事件。
  • 通过预定义槽中的文本片段,实现在文本中自动识别特定事件类型(如确诊结果和无法获得检测)。
  • 分析疫情期间社交媒体中自报病例及用户人口统计模式。
  • 通过向公众发布标注语料库和抽取工具,支持未来NLP研究。

提出的方法

  • 对7,500条推文进行手动标注,为每类事件定义预设的事件类型和槽填充结构。
  • 定义一组预设的事件槽(例如,事件类型、日期、地点),以标准化事件表示。
  • 应用序列标注和事件抽取技术,识别对应于每个槽的文本片段。
  • 使用统计和定性分析方法,研究自报病例和用户人口统计中的模式。
  • 基于标注语料库开发事件抽取工具,供下游应用使用。

实验结果

研究问题

  • RQ1在社交媒体文本中,能否准确识别出如确诊结果和无法获得检测等事件类型?
  • RQ2Twitter中的自报病例在多大程度上与官方病例数据或人口统计趋势一致?
  • RQ3在Twitter上报告COVID-19事件的用户中,其人口统计模式呈现出何种特征?
  • RQ4结构化的槽填充方法能否有效从非正式的社交媒体语言中抽取有意义的事件信息?

主要发现

  • 该标注语料库可通过槽填充实现对COVID-19事件的准确自动识别,支持结构化事件抽取。
  • 在语料库中发现了大量自报病例,反映出公众通过社交媒体进行实时公共卫生报告的现象。
  • 用户报告中的人口统计模式表明,不同用户群体的报告行为存在差异。
  • 该语料库及相关工具已公开发布,以支持NLP和公共卫生信息学领域的持续研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。