[论文解读] Graph based Neural Networks for Event Factuality Prediction using Syntactic and Semantic Structures
本文提出一种基于图的神经网络,联合建模句法与语义结构以进行事件真实性预测(EFP),利用图卷积网络(GCNs)将基于依存树的句法亲和矩阵与LSTM生成的语义亲和矩阵相结合。该模型在多个基准数据集上达到最先进性能,显著优于先前方法,在MAE与相关性指标上均表现更优。
Event factuality prediction (EFP) is the task of assessing the degree to which an event mentioned in a sentence has happened. For this task, both syntactic and semantic information are crucial to identify the important context words. The previous work for EFP has only combined these information in a simple way that cannot fully exploit their coordination. In this work, we introduce a novel graph-based neural network for EFP that can integrate the semantic and syntactic information more effectively. Our experiments demonstrate the advantage of the proposed model for EFP.
研究动机与目标
- 通过在统一的深度学习框架中有效整合句法与语义信息,提升事件真实性预测(EFP)性能。
- 解决先前模型仅在最终层拼接句法与语义表征的局限性,该方法可能放大噪声并忽略互补交互。
- 开发一种允许句法与语义结构早期交互的方法,以生成更鲁棒、更准确的EFP表征。
- 展示图卷积网络(GCNs)在建模长距离依赖与线索词识别方面的有效性。
- 在多个基准数据集上评估模型,并消融关键组件以验证其贡献。
提出的方法
- 模型从依存树构建句法亲和矩阵,基于句法依赖关系表示词语之间的连接。
- 利用句子的双向LSTM表征生成语义亲和矩阵,捕捉上下文与语义关系。
- 通过可学习超参数λ线性组合这两个亲和矩阵,形成用于GCN传播的增强亲和矩阵。
- 图卷积网络(GCNs)在增强图上传播表征,使每个词能够聚合来自其句法与语义邻居的信息。
- 最终表征经池化后输入回归头,预测[-3, +3]范围内的实值真实性分数。
- 模型使用平均绝对误差(MAE)损失进行端到端训练,并通过MAE与皮尔逊相关系数(r)进行评估。
实验结果
研究问题
- RQ1句法与语义结构的早期交互是否能超越后期拼接,在真实性预测中带来性能提升?
- RQ2将依存树结构与基于LSTM的语义表征相结合,在捕捉长距离线索词方面有多有效?
- RQ3句法与语义结构在EFP中单独及联合的贡献分别是什么?
- RQ4所提出的基于GCN的框架是否在标准EFP基准上优于现有最先进模型?
- RQ5BERT嵌入与预测头中的注意力机制对性能有何影响?
主要发现
- 所提模型在FactBank、UW、Meantime与UDS-IH2数据集上均达到最先进性能,在FactBank上MAE为0.310,相关系数为0.903。
- 在FactBank、UW与Meantime的联合数据集上进行训练后,模型在UDS-IH2上的MAE为0.204,相关系数为0.702,优于所有先前模型。
- 消融研究显示,若移除句法或语义结构,性能均会下降,其中两者同时移除时下降最明显(MAE: 0.352,r: 0.821)。
- 引入BERT嵌入与注意力机制显著提升性能,消融结果表明其效果显著(例如,MAE: 0.312 vs. 0.310,加入注意力后性能更优)。
- 在UDS-IH2上,λ=0.8时模型性能最佳,表明句法与语义信息之间达到最优平衡。
- 即使在Rudinger等人(2018)的SOTA模型增强BERT后,本模型仍表现更优,证明所提整合机制的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。