Skip to main content
QUICK REVIEW

[论文解读] Rewarding Coreference Resolvers for Being Consistent with World Knowledge

Rahul Aralikatte, Heather Lent|arXiv (Cornell University)|Sep 5, 2019
Software System Performance and Reliability参考文献 26被引用 5
一句话总结

本文提出了一种多任务强化学习框架,通过奖励模型生成与知识库(如Wikidata)中的世界知识一致的关系三元组的提及,从而提升共指消解性能。通过将开放关系抽取与通用模式奖励模型相结合,该方法在OntoNotes和WikiCoref数据集上实现了SOTA的F1分数,通过知识库的间接监督优化事实一致性,优于监督基线模型。

ABSTRACT

Unresolved coreference is a bottleneck for relation extraction, and high-quality coreference resolvers may produce an output that makes it a lot easier to extract knowledge triples. We show how to improve coreference resolvers by forwarding their input to a relation extraction system and reward the resolvers for producing triples that are found in knowledge bases. Since relation extraction systems can rely on different forms of supervision and be biased in different ways, we obtain the best performance, improving over the state of the art, using multi-task reinforcement learning.

研究动机与目标

  • 通过利用知识库中的世界知识作为监督的代理信号,解决高质量共指标注数据稀缺的问题。
  • 减少因缺乏名称-名称共指证据(如'Florida'与'the Sunshine State')而导致的共指错误,这些名称在训练数据中很少共现。
  • 通过训练消解器生成在关系抽取系统中能产生事实一致三元组的提及,从而提升共指消解性能。
  • 探究与外部知识库的一致性是否可作为端到端共指模型训练的强而可扩展的信号。

提出的方法

  • 该方法使用神经共指消解器在维基百科文档上生成提及指代预测。
  • 每个已消解的文档通过开放关系抽取(OpenRE)系统处理,以生成主语-关系-对象(SRO)三元组。
  • 利用在Wikidata上训练的通用模式模型(RE-KG)、维基百科共现数据(RE-Text)或联合信号(RE-Joint)对涉及共指提及的三元组进行评分,生成奖励。
  • 奖励通过过去100个episode的移动平均窗口对单个三元组得分进行归一化求和来计算,以稳定训练过程。
  • 采用策略梯度强化学习,利用奖励信号微调共指消解器,通过10%的概率随机选择动作实现探索。
  • 多任务训练通过模型蒸馏将三种奖励函数(RE-KG、RE-Text、RE-Joint)结合,生成统一且鲁棒的奖励信号。

实验结果

研究问题

  • RQ1与知识库中的世界知识一致性是否可作为共指消解的有效且可扩展的监督信号?
  • RQ2通过关系抽取引入事实一致性,相较于仅使用监督学习,能否显著提升共指消解性能?
  • RQ3使用互补奖励信号(知识库、文本共现、联合)的多任务强化学习是否优于单一来源奖励,从而实现更好的泛化能力?
  • RQ4该方法在减少涉及模糊或罕见名称变体(如'the Sunshine State'与'Florida')的共指链错误方面,效果如何?
  • RQ5模型是否能学会将非实体名词短语(如事件性名词短语'this attempt')进行链接,从而提升事实一致性,即使可能引入虚假链接?

主要发现

  • 所提方法在OntoNotes数据集上达到SOTA性能,F1分数相比监督基线提升0.78分(75.62 vs. 73.80)。
  • 在WikiCoref数据集上,模型实现了新的SOTA F1分数,表明其泛化能力超越OntoNotes。
  • 由于世界知识整合能力的提升,模型识别出更多实体,包括此前遗漏的' southern hemisphere'、'Cambridge'和'Oxford'等。
  • 模型倾向于将事件性名词短语(如'this attempt')链接至' releasing'等词,这虽提高了精确率,但略微降低了召回率。
  • 尽管召回率略有下降(70.75 vs. 71.34),但F1分数的总体提升显著,表明事实一致性得到明显改善。
  • 多任务奖励策略(RE-Joint)优于单一奖励函数,表明结合知识库与文本共现信号可增强模型鲁棒性与性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。