[论文解读] Extracting a Knowledge Base of COVID-19 Events from Social Media
本文提出一个手动标注的语料库,包含10,000条与COVID-19相关的推文,涵盖五类事件类型中的28个细粒度槽位——包括阳性/阴性检测、死亡、检测访问被拒,以及声称的治愈/预防措施。通过在该语料库上微调基于BERT的分类器,作者从数百万条推文中提取结构化事件,构建了CovidKB知识库,支持高精度的复杂查询,例如“休斯顿有哪些组织的员工检测呈阳性?”
In this paper, we present a manually annotated corpus of 10,000 tweets containing public reports of five COVID-19 events, including positive and negative tests, deaths, denied access to testing, claimed cures and preventions. We designed slot-filling questions for each event type and annotated a total of 31 fine-grained slots, such as the location of events, recent travel, and close contacts. We show that our corpus can support fine-tuning BERT-based classifiers to automatically extract publicly reported events and help track the spread of a new disease. We also demonstrate that, by aggregating events extracted from millions of tweets, we achieve surprisingly high precision when answering complex queries, such as "Which organizations have employees that tested positive in Philadelphia?" We will release our corpus (with user-information removed), automatic extraction models, and the corresponding knowledge base to the research community.
研究动机与目标
- 解决在COVID-19大流行期间,从社交媒体中提取及时、细粒度公共卫生信息的挑战。
- 克服官方数据通常存在延迟且缺乏个体或组织层面粒度的局限性。
- 构建一个高质量、语言信息丰富的数据集,以支持新兴危机中的监督式事件抽取。
- 构建一个可扩展的知识库,支持对Twitter上公开报告的事件进行复杂、结构化的查询。
- 支持流行病学家、记者和政策制定者进行公共卫生监测、虚假信息追踪和决策制定。
提出的方法
- 设计五类事件类型:阳性检测、阴性检测、检测访问被拒、死亡,以及声称的治愈/预防。
- 为28个细粒度语义槽位(例如位置、旅行史、密切接触者)设计填槽问题,以指导人工标注。
- 收集并标注10,000条推文,对每个槽位进行跨度级标注,确保语言精确性和一致性。
- 在标注语料库上微调基于BERT的序列分类模型,以自动提取结构化事件信息。
- 通过在数百万条推文上聚合提取结果,利用广泛讨论事件中的冗余性,提高精度。
- 将提取的事件索引到可搜索的知识库(CovidKB)中,支持使用类似自然语言语法的复杂、结构化查询。
实验结果
研究问题
- RQ1一个手动标注的、细粒度的社交媒体推文语料库,能否有效支持基于BERT的模型进行结构化事件抽取的训练?
- RQ2从大规模Twitter数据中聚合提取结果,在识别现实世界公共卫生事件方面,能达到多高的精度?
- RQ3所构建的知识库能否以高精度回答涉及位置、组织和暴露史等复杂、多事实的结构化查询?
- RQ4该系统在检测和索引关于治愈和预防措施的声明方面有多有效,这些可能有助于追踪虚假信息?
- RQ5该方法在多大程度上可快速适应其他新兴危机,如自然灾害或未来的疾病爆发?
主要发现
- 该语料库的槽位F1得分在0.3至0.9之间,大多数超过0.5,证明了为事件抽取进行细粒度标注的可行性。
- 在数百万条推文上聚合提取结果,可实现高精度回答复杂查询,例如识别费城中员工检测呈阳性的组织。
- 知识库CovidKB已索引超过420万条事件,数据来自两年的Twitter信息,支持实时、结构化查询。
- 该系统成功检测并追踪了关于治疗手段的公众话语演变,包括对羟氯喹和口罩的持续提及,以及对疫苗和药物(如氟伏沙明和单克隆抗体)关注度的上升。
- 该系统识别出治愈主张的主要推动者,包括公众人物(如唐纳德·特朗普、比尔·盖茨)、组织(如疾控中心、辉瑞公司)以及有争议的人物(如吉姆·贝克),突显了潜在的虚假信息传播路径。
- 尽管存在采样偏差(仅1%的公开推文)和在非标准方言上可能存在性能差距等局限,该系统在公共卫生监测和危机响应方面仍表现出强大的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。