[论文解读] CrudeOilNews: An Annotated Crude Oil News Corpus for Event Extraction
本文介绍了CrudeOilNews,这是首个用于事件抽取的英语原油新闻注释语料库,包含425篇文档,约11,000个事件。该语料库采用与ACE/ERE对齐的注释方式,并引入了新颖的强度标注;通过人机协同的主动学习与数据增强技术缓解类别不平衡问题;实现了显著的标注者间一致性,从而为金融NLP模型提供了高质量的训练数据。
In this paper, we present CrudeOilNews, a corpus of English Crude Oil news for event extraction. It is the first of its kind for Commodity News and serve to contribute towards resource building for economic and financial text mining. This paper describes the data collection process, the annotation methodology and the event typology used in producing the corpus. Firstly, a seed set of 175 news articles were manually annotated, of which a subset of 25 news were used as the adjudicated reference test set for inter-annotator and system evaluation. Agreement was generally substantial and annotator performance was adequate, indicating that the annotation scheme produces consistent event annotations of high quality. Subsequently the dataset is expanded through (1) data augmentation and (2) Human-in-the-loop active learning. The resulting corpus has 425 news articles with approximately 11k events annotated. As part of active learning process, the corpus was used to train basic event extraction models for machine labeling, the resulting models also serve as a validation or as a pilot study demonstrating the use of the corpus in machine learning purposes. The annotated corpus is made available for academic research purpose at https://github.com/meisin/CrudeOilNews-Corpus.
研究动机与目标
- 为解决金融与经济学领域商品新闻注释语料库的缺乏,特别是原油新闻方面的不足。
- 开发一种高质量、与ACE/ERE对齐的事件注释方案,专门针对原油新闻中的宏观经济、地缘政治及供需事件。
- 通过数据增强与主动学习缓解事件属性中的类别不平衡问题。
- 通过训练和评估基线事件抽取模型,证明该语料库的实用性。
- 为未来在文档级事件关系、共指消解及金融文本中的跨句事件推理研究提供支持。
提出的方法
- 构建了175篇手工注释的原油新闻文档作为初始语料集,其中25篇用作标注者间一致性检验的黄金标准测试集。
- 定义了一套与ACE/ERE标准对齐的事件注释方案,包括触发词、论元角色以及三种事件属性:极性(Polarity)、情态(Modality)和强度(Intensity)。
- 引入了新颖的“强度”属性,用于捕捉事件影响是否在加剧或缓解,从而增强事件表征能力。
- 应用数据增强技术对事件属性中的少数类别进行过采样,以减少类别不平衡。
- 采用人机协同的主动学习策略,结合不确定性采样(最小置信度)方法,迭代扩展语料库,重点针对模型预测置信度较低的样本进行人工标注。
- 在扩展后的语料库上训练并评估基线事件抽取模型,以验证其在机器学习任务中的实用性。
实验结果
研究问题
- RQ1考虑到原油新闻在语言特征和领域特定性方面的独特性,是否能有效应用高质量、与ACE/ERE对齐的事件注释方案?
- RQ2人机协同的主动学习在金融事件抽取任务中,是否能有效减少标注工作量,同时保持模型性能?
- RQ3对少数事件属性类别进行数据增强,在多大程度上能提升模型泛化能力并减少偏差?
- RQ4所提出的语料库是否能够支持金融领域中稳健且可泛化的事件抽取模型的训练?
- RQ5事件强度、极性和情态在多大程度上有助于实现对新闻中经济事件更完整、更具可操作性的表征?
主要发现
- 该语料库包含425篇文档、7,059个句子、10,578个事件以及22,267个论元,涵盖多种事件类型,总注释事件数超过11,000个。
- 标注者间一致性达到显著水平(大多数任务的Fleiss’ kappa > 0.60),证实了注释方案的一致性与高质量。
- 经过五轮主动学习迭代,模型性能逐步提升,微F1分数持续上升,不确定性采样频率随模型置信度提高而下降。
- 最小置信度采样策略有效识别出模糊案例(如贸易紧张 vs. 地缘政治紧张)和少数类实例。
- 引入“强度”属性使事件动态的表征更加细致,能够捕捉事件影响是否在加剧或缓解。
- 该语料库在训练和评估金融事件抽取模型方面展现出强大潜力,基线模型通过主动学习实现了可测量的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。