[论文解读] Cross-context News Corpus for Protest Events related Knowledge Base Construction
本文介绍了从印度、中国和南非的英文新闻来源中构建的跨语境金标准抗议事件语料库,由领域专家在文档、句子和词元层面进行标注,并通过主动学习和半自动错误检测进行优化。该语料库支持机器学习模型在自动化抗议事件抽取任务中的训练与基准测试,在真实世界随机数据上实现了最先进水平的召回率,并支持跨语境分类与共指消解的共享任务。
We describe a gold standard corpus of protest events that comprise of various local and international sources from various countries in English. The corpus contains document, sentence, and token level annotations. This corpus facilitates creating machine learning models that automatically classify news articles and extract protest event-related information, constructing knowledge bases which enable comparative social and political science studies. For each news source, the annotation starts on random samples of news articles and continues with samples that are drawn using active learning. Each batch of samples was annotated by two social and political scientists, adjudicated by an annotation supervisor, and was improved by identifying annotation errors semi-automatically. We found that the corpus has the variety and quality to develop and benchmark text classification and event extraction systems in a cross-context setting, which contributes to the generalizability and robustness of automated text processing systems. This corpus and the reported results will set the currently lacking common ground in automated protest event collection studies.
研究动机与目标
- 构建一个高质量、多语境的金标准语料库,用于抗议事件信息抽取,以支持社会科学中的机器学习研究。
- 通过提供多国、多新闻来源的标准化标注数据集,解决自动化抗议事件收集中缺乏通用基准的问题。
- 通过整合语言风格和内容的跨语境差异,提升自然语言处理工具的鲁棒性与泛化能力。
- 利用真实世界随机测试数据,实现对文本分类、事件抽取和共指消解系统的基准测试。
提出的方法
- 从印度、中国和南非的本地及国际新闻来源中,构建了超过10,000篇英文新闻文章的金标准语料库。
- 采用多级标注:文档级(抗议 vs. 非抗议)、句子级(事件存在性)、词元级(事件触发词、语义类别、地点、时间、参与者、共指关系)。
- 采用混合标注流程:初始随机采样后,通过主动学习优先标注信息量高的样本,结合双重标注与主管仲裁。
- 实施人工与半自动质量检查,以检测并纠正标注错误,提升语料库的可靠性。
- 开发并评估了基于该语料库的机器学习模型流水线,用于文档分类、句子级事件检测和词元级信息抽取。
- 通过CLEF 2019和LREC 2020的共享任务验证了语料库的有效性,证明其在跨语境评估中的实用性。
实验结果
研究问题
- RQ1如何在多样化新闻来源和国家背景下,构建一个高质量、多语境的抗议事件信息抽取金标准语料库?
- RQ2在多语境差异中引入语言风格与内容变化,能在多大程度上提升自然语言处理模型在抗议事件检测中的鲁棒性与泛化能力?
- RQ3在该语料库上训练的机器学习流水线在跨语境文档、句子和词元级分类任务中的表现如何?
- RQ4主动学习与半自动错误纠正的引入,如何提升最终金标准语料库的质量与可靠性?
- RQ5该语料库能否支持在真实随机数据上的最先进召回率评估,而非受限或有偏见的测试集?
主要发现
- 语料库包含超过10,000篇新闻文章,其中800多篇抗议相关文章在句子和词元层面被标注了事件触发词、地点、时间、参与者和共指关系。
- 最佳性能流水线配置(Doc+Sent+Tok)在200篇文章的测试集上达到F1-macro分数0.614,事件触发词检测的精确率为0.701,召回率为0.547。
- 词元级事件抽取在触发词上达到F1分数0.722,时间0.683,地点0.683,目标0.491,表明对核心事件要素具有优异性能。
- 该语料库成功支持了CLEF 2019和LREC 2020的共享任务,参与者结果与报告性能相当,验证了其基准测试价值。
- 本研究首次实现了在真实随机数据上的最先进水平召回率量化,克服了以往评估设置的局限性。
- 当测试数据与训练数据存在差异时,观察到显著的性能下降,凸显了在模型训练与评估中使用跨语境数据的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。