[论文解读] Counting Protests in News Articles: A Dataset and Semi-Automated Data Collection Pipeline
本文介绍了一个从2017年1月至2021年1月期间美国地方新闻报道中人工整理的抗议事件数据集,共包含42,347起事件,以及一个半自动化的数据收集与标注流程。该研究对基于LSTM的分类器进行了基准测试,当使用段落级句法单元进行事件计数时,F1得分平均达到82.6,证明了结构化文本分析在新闻媒体事件抽取中的有效性。
Between January 2017 and January 2021, thousands of local news sources in the United States reported on over 42,000 protests about topics such as civil rights, immigration, guns, and the environment. Given the vast number of local journalists that report on protests daily, extracting these events as structured data to understand temporal and geographic trends can empower civic decision-making. However, the task of extracting events from news articles presents well known challenges to the NLP community in the fields of domain detection, slot filling, and coreference resolution. To help improve the resources available for extracting structured data from news stories, our contribution is three-fold. We 1) release a manually labeled dataset of news article URLs, dates, locations, crowd size estimates, and 494 discrete descriptive tags corresponding to 42,347 reported protest events in the United States between January 2017 and January 2021; 2) describe the semi-automated data collection pipeline used to discover, sort, and review the 144,568 English articles that comprise the dataset; and 3) benchmark a long-short term memory (LSTM) low dimensional classifier that demonstrates the utility of processing news articles based on syntactic structures, such as paragraphs and sentences, to count the number of reported protest events.
研究动机与目标
- 为解决从非结构化地方新闻报道中提取结构化抗议事件数据的挑战,此类数据对公民与政治分析至关重要。
- 创建一个大规模、人工标注的抗议事件数据集,包含详细的元数据,如日期、地点、人群规模和描述性标签。
- 开发并验证一种半自动化的数据收集流程,能够以极少的人工干预每晚处理数千篇新闻报道。
- 评估自然语言处理模型在新闻报道中计数抗议事件的性能,重点关注句法结构与序列建模。
- 通过标准化、可访问的数据,为未来在事件抽取、公民数据研究以及社会运动的纵向研究提供支持。
提出的方法
- 该数据集包含138,826条新闻报道URL,共在494种描述性标签中人工标注了42,347起独特的抗议事件,包括时间状态(过去/未来)、地点、人群规模和抗议主题等。
- 一种半自动化的流程利用网络爬取、URL去重和基于相似性的排序,识别并优先处理需人工审查的文章,从而在保持数据质量的同时减少人工工作量。
- 核心方法是训练一个长短期记忆(LSTM)网络,以分类每篇文章中的抗议事件数量,使用三种句法输入单元:词元、句子和段落。
- 模型在10,000次迭代中使用分层采样平衡各类(每篇文章中0、1、2或3+起事件),并通过早停法防止过拟合,损失函数为分类交叉熵。
- 通过精确率、召回率和F1得分评估性能,不同句法输入单元的表现结果表明,段落级编码效果最佳。
- 数据集通过公开的GitHub仓库发布,包含URL和示例代码,但由于版权限制,完整语料库未对外分发。
实验结果
研究问题
- RQ1半自动化的流程能否在极少人工干预的情况下,有效扩展从地方新闻报道中收集和标注抗议事件的规模?
- RQ2选择不同的句法单元(词元、句子或段落)如何影响LSTM模型在新闻报道中计数抗议事件的性能?
- RQ3低维LSTM分类器在区分包含零起、一起、两起或更多抗议事件的文章方面表现如何?
- RQ4段落等句法结构在多大程度上提升了模型解析长期依赖关系以实现事件计数的能力?
- RQ5模型在识别负样本(提及抗议相关术语但未描述实际抗议事件的文章)方面的有效性如何?
主要发现
- 基于段落的LSTM模型取得了最高的F1得分82.6,优于基于句子(82.9)和基于词元(80.4)的模型,表明更大的句法单元能提升事件计数的准确性。
- 该模型在识别无抗议事件的文章方面表现最佳(F1 = 90.4),表明其对非抗议内容具有强大的领域区分能力。
- 对于包含两起抗议事件的文章,性能显著下降(F1 = 43.2),主要原因是被误分类为单起事件,凸显了在区分双重事件方面的挑战。
- 基于句子的模型在识别单起事件文章方面取得F1 80.5,优于基于词元的模型(78.3),表明句级编码比原始词元更能捕捉事件上下文。
- 模型在所有类别上的加权平均F1为82.6,表明将事件计数重构为多分类任务是一种可行且有效的策略。
- 半自动化的流程在四年内仅由两名研究人员成功处理了138,826篇文章,通过迭代排序与审查实现了高质量的数据产出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。