Skip to main content
QUICK REVIEW

[论文解读] Closed-Book Training to Improve Summarization Encoder Memory

Yichen Jiang, Mohit Bansal|arXiv (Cornell University)|Sep 12, 2018
Topic Modeling参考文献 40被引用 4
一句话总结

本文提出一种用于抽取式摘要的双解码器序列到序列模型,其中无需注意力或复制机制的闭卷解码器迫使共享编码器更好地记忆长输入文本中的关键信息。该方法在CNN/Daily Mail和DUC-2002数据集上显著提升了ROUGE和METEOR得分,通过显著性测试和消融研究验证了编码器记忆能力的增强。

ABSTRACT

A good neural sequence-to-sequence summarization model should have a strong encoder that can distill and memorize the important information from long input texts so that the decoder can generate salient summaries based on the encoder's memory. In this paper, we aim to improve the memorization capabilities of the encoder of a pointer-generator model by adding an additional 'closed-book' decoder without attention and pointer mechanisms. Such a decoder forces the encoder to be more selective in the information encoded in its memory state because the decoder can't rely on the extra information provided by the attention and possibly copy modules, and hence improves the entire model. On the CNN/Daily Mail dataset, our 2-decoder model outperforms the baseline significantly in terms of ROUGE and METEOR metrics, for both cross-entropy and reinforced setups (and on human evaluation). Moreover, our model also achieves higher scores in a test-only DUC-2002 generalizability setup. We further present a memory ability test, two saliency metrics, as well as several sanity-check ablations (based on fixed-encoder, gradient-flow cut, and model capacity) to prove that the encoder of our 2-decoder model does in fact learn stronger memory representations than the baseline encoder.

研究动机与目标

  • 通过引入一个无注意力或复制机制的辅助解码器,提升序列到序列摘要模型中编码器的记忆能力。
  • 解决现有模型在编码长输入文本时难以识别和保留关键信息的局限性。
  • 证明通过强制编码器在不依赖注意力或复制机制的情况下提炼关键内容,可形成更强的记忆表征。
  • 验证改进的编码器记忆能力是否能转化为自动评估与人工评估指标下的更好摘要性能。

提出的方法

  • 提出双解码器架构,其中带有注意力和复制机制的指针-生成解码器与无注意力或复制机制的闭卷解码器共享同一个编码器。
  • 通过优化两个解码器损失函数的加权和,联合训练两个解码器,促使编码器生成能同时支持抽象生成与非注意力生成的记忆状态。
  • 将闭卷解码器用作正则化器,通过强制其仅依赖最终编码器状态,提升编码器的选择性与长期记忆保持能力。
  • 采用LSTM实现模型,共享嵌入与共享编码器参数,实现解码器之间的参数高效知识迁移。
  • 在交叉熵与强化学习两种训练设置下进行实验,以评估模型的泛化能力与鲁棒性。
  • 通过固定编码器、梯度流切断与模型容量控制等消融实验,隔离闭卷解码器对编码器记忆能力的影响。

实验结果

研究问题

  • RQ1在指针-生成解码器之外联合训练一个闭卷解码器,是否能提升编码器从长输入文本中记忆关键信息的能力?
  • RQ2采用非注意力解码器的双解码器架构,是否能带来优于标准指针-生成模型的摘要性能?
  • RQ3性能提升是源于辅助解码器的设计,还是仅仅由于模型容量增加或集成效应?
  • RQ4改进的编码器记忆能力在如DUC-2002这类跨领域测试集上,能在多大程度上体现为更好的显著性与泛化能力?
  • RQ5与基线模型相比,该模型在摘要长度、冗余度与抽象性方面表现如何?

主要发现

  • 在CNN/Daily Mail数据集上,双解码器模型(pg + cbdec)在交叉熵设置下取得43.7的ROUGE-L F1得分,显著优于指针-生成基线模型的42.1。
  • 在强化学习设置下,双解码器模型取得44.1的ROUGE-L F1得分,而基线为42.5,表明在不同训练范式下均保持一致的性能提升。
  • 该模型在DUC-2002的仅测试集设置下表现出更强的泛化能力,交叉熵设置下ROUGE-L F1得分为32.4,强化学习设置下为33.1,均优于基线。
  • 记忆能力测试显示,双解码器模型能恢复66.2%的源文本关键词,而基线仅为58.9%,表明其编码器记忆能力更强。
  • 基于SQuAD数据集中关键词检测的显著性度量显示,双解码器模型更好地保留了重要信息,关键词恢复率达66.2%,高于基线的58.9%。
  • 该模型生成的摘要长度相近(66.42 vs. 65.88词),但冗余度更低,表明在不增加重复或长度的前提下提升了内容显著性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。