[论文解读] Deep Reinforcement Learning for Chinese Zero pronoun Resolution
本文提出了一种用于中文零代词消解的深度强化学习框架,将先行词选择建模为一个顺序决策过程,利用先前预测的先行词来提升长期决策的准确性。通过使用基于策略的强化学习来优化全局性能,该模型在OntoNotes 5.0数据集上实现了67.2%的SOTA F-score,优于现有方法。
Deep neural network models for Chinese zero pronoun resolution learn semantic information for zero pronoun and candidate antecedents, but tend to be short-sighted---they often make local decisions. They typically predict coreference chains between the zero pronoun and one single candidate antecedent one link at a time, while overlooking their long-term influence on future decisions. Ideally, modeling useful information of preceding potential antecedents is critical when later predicting zero pronoun-candidate antecedent pairs. In this study, we show how to integrate local and global decision-making by exploiting deep reinforcement learning models. With the help of the reinforcement learning agent, our model learns the policy of selecting antecedents in a sequential manner, where useful information provided by earlier predicted antecedents could be utilized for making later coreference decisions. Experimental results on OntoNotes 5.0 dataset show that our technique surpasses the state-of-the-art models.
研究动机与目标
- 为了解决现有深度学习模型在零代词消解中的局限性,即仅做短视的、局部的决策,而未考虑对未来预测的长期影响。
- 通过利用先前预测的先行词中的语言线索,整合全局上下文信息,以指导后续的共指决策。
- 将零代词消解建模为一个顺序决策过程,采用强化学习方法,使模型能够优化整体性能而非单个链接的预测。
- 通过学习一种平衡即时决策与长期后果的策略,提升回指型零代词消解的准确性。
提出的方法
- 该模型将给定零代词的所有先前预测先行词编码为一个代表性向量,作为上下文信息用于指导后续的共指决策。
- 基于策略的深度强化学习智能体被训练为逐步选择先行词,其中动作对应于将零代词链接到候选提及项。
- 智能体根据整体共指链的质量接收一个全局奖励信号,从而实现对整个预测序列的优化,而非单个链接。
- 模型使用神经网络对零代词和候选先行词进行编码,并根据预测先行词的历史记录更新隐藏状态。
- 通过策略梯度方法优化策略,使模型能够学习哪些决策能带来更高的累积奖励。
- 该框架在OntoNotes 5.0数据集上进行端到端训练,仅在最终的共指链结构上提供监督信号。
实验结果
研究问题
- RQ1强化学习智能体是否能通过建模先行词预测之间的长期依赖关系来提升零代词消解性能?
- RQ2利用先前预测的先行词信息在多大程度上影响了后续共指决策的准确性?
- RQ3基于策略的强化学习方法是否能优于标准深度学习模型,后者对每个零代词-候选对独立地做出局部预测?
- RQ4与局部损失最小化相比,优化全局性能指标在多大程度上提升了最终的F-score?
主要发现
- 所提出的深度强化学习模型在OntoNotes 5.0测试集上实现了67.2%的F-score,超越了所有先前的SOTA模型。
- 该模型显著优于基线神经网络模型,后者对每个零代词-候选对独立做出孤立的局部决策。
- 整合先前预测先行词的信息可显著提升后续共指链接的预测准确性,尤其在模糊情况下表现更优。
- 基于策略的强化学习方法使模型能够学习全局决策策略,从而减少因短视的局部预测导致的错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。