Skip to main content
QUICK REVIEW

[论文解读] Event Identification as a Decision Process with Non-linear Representation of Text

Yukun Yan, Daqi Zheng|arXiv (Cornell University)|Oct 3, 2017
Topic Modeling参考文献 12被引用 7
一句话总结

本文提出了一种无尺度标识网络(sfIN),这是一种新颖的事件识别模型,通过分层多尺度记忆堆栈和强化学习优化的控制器,实现非线性、序列级标注。通过在词、句子和段落层级上使用双向LSTM编码器处理文本并支持大规模动作,sfIN在长篇法律文档上实现了93.02%的F1分数,较LSTM-CRF模型高出超过10个百分点。

ABSTRACT

We propose scale-free Identifier Network(sfIN), a novel model for event identification in documents. In general, sfIN first encodes a document into multi-scale memory stacks, then extracts special events via conducting multi-scale actions, which can be considered as a special type of sequence labelling. The design of large scale actions makes it more efficient processing a long document. The whole model is trained with both supervised learning and reinforcement learning.

研究动机与目标

  • 通过使用非线性表示建模多层级语言结构(词、句子、段落),提升长文档中的事件识别性能。
  • 通过支持跨越多个词元的大规模动作,解决长文本中顺序标注的低效问题。
  • 结合监督学习与策略梯度强化学习,优化准确率与处理效率。
  • 将事件检测建模为受分层记忆与动态动作选择引导的决策过程。

提出的方法

  • 使用双向LSTM层和最大池化操作,将文本编码为三个分层记忆堆栈——词级、句子级和段落级,以提取全局特征。
  • 基于RNN的控制器从三个读取头读取多尺度记忆,并通过九个前馈网络生成动作得分。
  • 动作包括在词、句子或段落层级上将事件标记为“非事件”、“当前事件”或“新事件”,并据此生成标记序列。
  • 控制器在每一步对正确动作进行多项式采样,并采用混合损失函数进行训练,结合监督学习与策略梯度优化。
  • 策略梯度部分奖励使用更少、更大动作的模型,从而在不牺牲准确率的前提下提升效率。
  • 模型从上至下处理文档,在每步动作后更新读取头位置,直至文本结束。

实验结果

研究问题

  • RQ1与标准RNN模型相比,文本的分层多尺度表示是否能提升长文档中的事件识别性能?
  • RQ2支持大规模动作(如对整个句子或段落进行标记)是否能在保持高准确率的同时提升处理效率?
  • RQ3结合监督学习与策略梯度强化学习的混合训练策略,能否在事件标注中平衡准确率与动作效率?
  • RQ4在动作粒度与结构感知方面,该模型的决策过程与人类信息抽取行为相比如何?

主要发现

  • sfIN在测试集上达到93.02%的F1分数,显著优于LSTM-CRF基线模型的79.00%。
  • 该模型在长文档(1,500至7,000词)上表现尤为出色,展现出卓越的可扩展性与效率。
  • 使用大规模动作显著减少了标注所需步数,提升了处理效率,且未损失精度。
  • 该模型表现出类人行为:在关键事件词处使用低层级动作,而在背景刑事信息等不关键部分使用高层级动作。
  • 混合训练策略(结合监督学习与策略梯度)使模型能够学习到高效的动作策略,从而在准确率与动作跨度之间实现最优平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。