Skip to main content
QUICK REVIEW

[论文解读] Doc2EDAG: An End-to-End Document-level Framework for Chinese Financial Event Extraction

Shun Zheng, Wei Cao|arXiv (Cornell University)|Apr 16, 2019
Topic Modeling参考文献 34被引用 4
一句话总结

本文提出 Doc2EDAG,一种用于中文金融公告的端到端文档级事件抽取框架,将事件抽取建模为基于实体的有向无环图(EDAG)生成。通过利用文档级上下文编码和记忆增强的路径扩展机制,其在多个方面显著优于当前最先进方法,尤其在多事件和论元分散场景下表现突出,在 EO 事件类型上相较最佳基线最高提升 28.4 F1。

ABSTRACT

Most existing event extraction (EE) methods merely extract event arguments within the sentence scope. However, such sentence-level EE methods struggle to handle soaring amounts of documents from emerging applications, such as finance, legislation, health, etc., where event arguments always scatter across different sentences, and even multiple such event mentions frequently co-exist in the same document. To address these challenges, we propose a novel end-to-end model, Doc2EDAG, which can generate an entity-based directed acyclic graph to fulfill the document-level EE (DEE) effectively. Moreover, we reformalize a DEE task with the no-trigger-words design to ease the document-level event labeling. To demonstrate the effectiveness of Doc2EDAG, we build a large-scale real-world dataset consisting of Chinese financial announcements with the challenges mentioned above. Extensive experiments with comprehensive analyses illustrate the superiority of Doc2EDAG over state-of-the-art methods. Data and codes can be found at https://github.com/dolphin-zs/Doc2EDAG.

研究动机与目标

  • 为解决句子级事件抽取在处理金融文档中常见的论元分散与多事件场景时的局限性。
  • 提出一种无需依赖触发词和关键事件句启发式规则的文档级端到端事件抽取模型。
  • 构建一个大规模、真实世界的中文金融公告数据集,标注用于文档级事件抽取。
  • 评估端到端建模结合文档级上下文与记忆增强路径扩展在复杂事件结构上的有效性。
  • 证明所提出的无触发词形式化在弱监督基于标签化中的优越性。

提出的方法

  • Doc2EDAG 将文档级事件抽取建模为基于实体的有向无环图(EDAG)生成,将表格填充任务转化为序列路径扩展子任务。
  • 采用基于 Transformer 的编码器生成文档级实体表示,捕捉跨句子的长距离依赖关系。
  • 引入记忆机制,在 EDAG 构建过程中维护并更新路径状态,实现对部分事件结构的有效追踪。
  • 训练过程中使用调度采样(scheduled sampling),通过逐步将预测实体引入输入,减少训练与推理之间的分布偏移。
  • 模型端到端训练,直接从原始文档预测事件表,无需触发词标注或关键事件句检测。
  • 提出一种无触发词形式化,将 DEE 视为直接表格填充,简化标注流程并提升与事件抽取最终目标的一致性。

实验结果

研究问题

  • RQ1端到端的文档级事件抽取模型是否能优于依赖关键事件句检测与启发式论元补全的两阶段方法?
  • RQ2结合记忆增强路径扩展的 EDAG 生成策略在处理论元分散与多事件场景时效果如何?
  • RQ3在弱监督基于标签化的 DEE 中,去除对触发词标注的需求是否能提升鲁棒性与性能?
  • RQ4文档级上下文编码在多大程度上增强了模型解析跨句论元与多重事件的能力?
  • RQ5调度采样策略在多阶段路径扩展中如何缓解训练与推理之间的差异?

主要发现

  • 在 EF 事件类型上,Doc2EDAG 相较最佳基线(DCFEE-O)提升 19.1 F1,证明其在论元分散案例中表现强劲。
  • 在多事件测试集上,Doc2EDAG 相较 DCFEE-O 提升 17.7 F1,凸显其在处理复杂重叠事件结构方面的有效性。
  • 消融实验表明,移除记忆机制导致性能下降最大——在四个事件类型上均超过 10 F1 点,证明其在路径追踪中的关键作用。
  • 调度采样使平均 F1 提升 5 点,证实其在缓解训练-推理分布偏移方面的价值。
  • 文档级实体编码平均贡献 2.1 F1 点,表明全局上下文能提升实体表示质量。
  • 在路径扩展中使用更高的负类权重可减少误报,并在所有事件类型上实现稳定且可测量的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。