Skip to main content
QUICK REVIEW

[论文解读] The Referential Reader: A Recurrent Entity Network for Anaphora Resolution

Fei Liu, Luke Zettlemoyer|arXiv (Cornell University)|Feb 5, 2019
Topic Modeling参考文献 19被引用 4
一句话总结

该论文提出了参照阅读器(Referential Reader),一种可微分的循环实体网络,通过维护一个固定大小的实体提及记忆,在在线文本处理过程中逐步解析回指现象。它使用可学习门控机制更新或覆盖记忆单元,在端到端训练中结合了监督式共指消解与无监督语言建模目标,实现了在GAP数据集上的优异性能。

ABSTRACT

We present a new architecture for storing and accessing entity mentions during online text processing. While reading the text, entity references are identified, and may be stored by either updating or overwriting a cell in a fixed-length memory. The update operation implies coreference with the other mentions that are stored in the same cell; the overwrite operation causes these mentions to be forgotten. By encoding the memory operations as differentiable gates, it is possible to train the model end-to-end, using both a supervised anaphora resolution objective as well as a supplementary language modeling objective. Evaluation on a dataset of pronoun-name anaphora demonstrates strong performance with purely incremental text processing.

研究动机与目标

  • 解决提及对模型在回指消解中的局限性,这些模型计算成本高且在认知上不切实际,因其具有批处理特性。
  • 开发一种可逐步处理文本的模型,模仿人类的在线参考解析行为。
  • 实现端到端训练,结合监督式共指消解与无监督语言建模目标,以提升泛化能力。
  • 集成一种可微分的记忆机制,支持在线更新与覆盖,结合显著性记忆保留机制。
  • 在GAP数据集上验证模型在增量处理下的有效性,用于代词-名称回指消解。

提出的方法

  • 使用固定长度的记忆单元(键、值、显著性)元组表示实体,其中键为查询表示,值为实体嵌入。
  • 利用输入词元与先前隐藏状态导出的预循环状态,通过可微分门控机制控制记忆操作。
  • 通过预循环状态上的Sigmoid门控计算实体提及检测,判断某词元是否为候选实体引用。
  • 通过从预循环状态导出的查询向量,对记忆键进行注意力计算,识别潜在的先行词。
  • 将更新门和覆盖门作为连续的可微函数应用:更新门为基于参考概率加权的注意力分数,覆盖门为学习得到的替换记忆内容的决策。
  • 通过一个动态门控机制将记忆状态整合到GRU隐藏状态更新中,平衡先前隐藏状态与记忆的贡献。

实验结果

研究问题

  • RQ1可微分的、端到端可训练的记忆网络能否在增量回指消解中实现优异性能?
  • RQ2在半监督设置下,无监督语言建模预训练在多大程度上能提升共指消解性能?
  • RQ3该模型在实时处理中对共指链和回指引用的处理效果如何?
  • RQ4记忆显著性机制是否能有效优先保留显著实体,减少对相关先行词的覆盖?
  • RQ5该模型能否在无显式语言学监督的情况下学习句法显著性模式(如主语与介词短语)?

主要发现

  • 当与语言建模目标联合训练时,参照阅读器在GAP测试集上达到71.4的F1分数,优于仅使用监督目标的基线模型。
  • 该模型展现出强大的增量处理行为,可在无需完整文档上下文的情况下实时解析引用。
  • 引入语言建模目标显著提升了性能,减少了仅使用共指消解目标时的F1分数下降。
  • 该模型学会忽略低显著性提及(如介词短语中的名字),优先关注代词和高显著性实体,与中心化理论原则一致。
  • 可视化结果表明,即使在复杂情况下(如回指引用,例如句子中‘his’指代后文的‘Avant’),模型也能正确建立共指链接。
  • 该模型的记忆显著性机制能有效在长跨度中保留相关实体,减少错误覆盖,提升长距离共指消解性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。