[论文解读] MLBiNet: A Cross-Sentence Collective Event Detection Network
本文提出 MLBiNet,一种多层双向神经网络,可联合建模文档级语义信息与跨句事件依赖关系,用于集体事件检测。通过采用双向解码器、信息聚合模块以及堆叠解码层,MLBiNet 捕获句内与句间依赖关系,在 ACE 2005 基准测试中取得 85.7 的新 SOTA F1 分数,较之前方法提升 1.9 分。
We consider the problem of collectively detecting multiple events, particularly in cross-sentence settings. The key to dealing with the problem is to encode semantic information and model event inter-dependency at a document-level. In this paper, we reformulate it as a Seq2Seq task and propose a Multi-Layer Bidirectional Network (MLBiNet) to capture the document-level association of events and semantic information simultaneously. Specifically, a bidirectional decoder is firstly devised to model event inter-dependency within a sentence when decoding the event tag vector sequence. Secondly, an information aggregation module is employed to aggregate sentence-level semantic and event tag information. Finally, we stack multiple bidirectional decoders and feed cross-sentence information, forming a multi-layer bidirectional tagging architecture to iteratively propagate information across sentences. We show that our approach provides significant improvement in performance compared to the current state-of-the-art results.
研究动机与目标
- 解决现有事件检测模型忽略文档级语义信息与事件依赖关系的局限性。
- 显式建模句内与句间事件依赖关系,尤其在事件触发词分散于多句的情况下。
- 将文档级语义聚合与事件依赖关系建模统一为单一、端到端可训练的框架。
- 通过堆叠解码架构在句间迭代传播信息,提升集体事件检测性能。
提出的方法
- 设计双向解码器,通过捕捉事件标签序列中的前向与后向依赖关系,建模每句话内的事件依赖关系。
- 信息聚合模块通过池化操作(如平均池化、最大池化或基于 LSTM 的聚合)总结句子级别的语义与事件标签信息。
- 将多个双向解码层堆叠,实现相邻句子间的信息传播,通过迭代优化实现长距离上下文建模。
- 将事件检测视为 Seq2Seq 任务,输入为文档,输出为事件标签序列,支持多个事件的联合预测。
- 通过将前一层的输出传递给下一层,实现句间信息的层次化传播,使上下文信号在句间流动。
- 采用事件标签序列预测的交叉熵损失,对整个架构进行端到端训练。
实验结果
研究问题
- RQ1统一的深度学习框架能否有效建模集体事件检测中的文档级语义信息与事件依赖关系?
- RQ2与单向或非循环标记结构相比,句内双向解码在建模事件依赖关系方面有何优势?
- RQ3堆叠的双向解码层在多大程度上能增强句间信息传播并提升检测准确率?
- RQ4所提出的的信息聚合模块能否有效总结每句话的相关语义与事件信号,供下游层使用?
- RQ5在 ACE 2005 基准测试中,MLBiNet 与 SOTA 模型相比,在 F1 分数与鲁棒性方面表现如何?
主要发现
- MLBiNet 在 ACE 2005 基准测试中取得 85.7 的新 SOTA F1 分数,较之前最佳结果提升 1.9 分。
- 消融实验表明,双向解码器与多层堆叠机制均对性能提升有显著贡献。
- 基于 LSTM 的信息聚合模块优于平均池化与最大池化,表明对事件信号的序列建模可增强检测效果。
- 模型有效捕捉了句间依赖关系,表现为在邻近句子提供上下文时,对 'firing' 与 'death' 等事件触发词的检测性能显著提升。
- 在涉及共现事件的情况下性能增益尤为显著,ACE 2005 语料库中 44.4% 的触发词处于此类配置中。
- 模型在处理模糊触发词(如 'firing' 可表示 'Attack' 或 'End_Position')时表现出鲁棒性,通过利用句间上下文实现准确判别。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。