Skip to main content
QUICK REVIEW

[论文解读] Sequence to Sequence Learning for Event Prediction

Dai Quoc Nguyen, Dat Quoc Nguyen|arXiv (Cornell University)|Sep 18, 2017
Topic Modeling参考文献 17被引用 10
一句话总结

本文提出一种基于双向多层RNN(BiLSTM/BiGRU)与注意力机制的序列到序列学习模型,用于事件预测,在BLEU得分上显著优于先前工作,并通过真实改写语料集引入语义评估。该模型在语义正确性上达到31%的准确率,较基线提升3.4个百分点,在开放域(WikiHow)与封闭域(DeScript)数据集上均表现出稳健性能。

ABSTRACT

This paper presents an approach to the task of predicting an event description from a preceding sentence in a text. Our approach explores sequence-to-sequence learning using a bidirectional multi-layer recurrent neural network. Our approach substantially outperforms previous work in terms of the BLEU score on two datasets derived from WikiHow and DeScript respectively. Since the BLEU score is not easy to interpret as a measure of event prediction, we complement our study with a second evaluation that exploits the rich linguistic annotation of gold paraphrase sets of events.

研究动机与目标

  • 解决基于前序事件描述预测叙事序列中下一个事件的挑战。
  • 通过利用具有双向性和多层结构的RNN序列到序列架构,改进先前在事件预测任务中的工作。
  • 提出一种基于真实改写语料集的语义评估方法,以衡量预测结果的正确性,超越表面层面的BLEU得分。
  • 构建并发布两个新数据集——基于WikiHow的(开放域)与基于DeScript的(封闭域)——以促进事件预测研究。

提出的方法

  • 使用双向长短期记忆网络(BiLSTM)或门控循环单元(BiGRU)编码器,将源事件句子编码为上下文隐藏状态。
  • 采用带或不带注意力机制的单向RNN解码器,逐个标记生成下一个事件描述。
  • 基于Vinyals等人(2015)的方法应用注意力机制,使解码器在解码过程中能动态关注源序列的相关部分。
  • 使用交叉熵损失端到端训练模型,以最大化真实目标序列的似然概率。
  • 使用标准BLEU得分与基于DeScript语料中真实改写语料集的新型语义评估方法联合评估性能。
  • 采用两阶段评估:第一阶段在测试集上计算标准BLEU得分;第二阶段通过检查预测事件与目标事件是否属于同一改写语料集,评估语义准确率。

实验结果

研究问题

  • RQ1基于双向与多层RNN的序列到序列模型是否能在开放域与封闭域数据集上均超越先前方法在事件预测任务中的表现?
  • RQ2注意力机制的引入如何影响事件预测模型的性能?
  • RQ3BLEU得分在多大程度上与事件预测的语义正确性相关?基于改写的评估是否能提供更具意义的度量?
  • RQ4模型深度(单层与多层)对事件生成任务中预测质量有何影响?
  • RQ5人类在该预测任务上的性能上限是多少?模型表现与人类表现相比如何?

主要发现

  • 所提出的带注意力机制的两层BiLSTM Seq2Seq模型在基于DeScript的测试集上达到6.19的BLEU得分,显著优于先前工作。
  • 在基于DeScript的改写语料集评估中,该模型实现了31%的语义准确率,其中包含24%的基础准确率与7%的近似纠正率,较基线提升3.4个百分点。
  • 注意力机制在较短源句(≤10个词)上提升性能,但在长序列上性能下降,表明注意力机制在长上下文场景中存在局限性。
  • 该模型在开放域WikiHow数据集上表现出强泛化能力,各类句长下均取得高BLEU得分。
  • 基于DeScript的改写语料评估表明,仅依赖BLEU得分不足以评估语义正确性,验证了引入语义评估指标的必要性。
  • 事件预测的随机基线准确率仅为4%,表明该任务具有挑战性,而模型31%的准确率代表了实质性进展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。