[论文解读] Mixture Content Selection for Diverse Sequence Generation
本文提出了一种即插即用的内容选择模块——Selector,通过使用专家混合模型对源序列进行二值掩码采样,实现对多种不同内容焦点的生成,从而增强序列生成的多样性。该模块与标准编码器-解码器模型集成后,在问题生成和抽象摘要任务中实现了最先进(SOTA)的 top-1 准确率,top-5 准确率高出先前方法 6%,训练速度提升 3.7 倍。
Generating diverse sequences is important in many NLP applications such as question generation or summarization that exhibit semantically one-to-many relationships between source and the target sequences. We present a method to explicitly separate diversification from generation using a general plug-and-play module (called SELECTOR) that wraps around and guides an existing encoder-decoder model. The diversification stage uses a mixture of experts to sample different binary masks on the source sequence for diverse content selection. The generation stage uses a standard encoder-decoder model given each selected content from the source sequence. Due to the non-differentiable nature of discrete sampling and the lack of ground truth labels for binary mask, we leverage a proxy for ground truth mask and adopt stochastic hard-EM for training. In question generation (SQuAD) and abstractive summarization (CNN-DM), our method demonstrates significant improvements in accuracy, diversity and training efficiency, including state-of-the-art top-1 accuracy in both datasets, 6% gain in top-5 accuracy, and 3.7 times faster training over a state of the art model. Our code is publicly available at https://github.com/clovaai/FocusSeq2Seq.
研究动机与目标
- 解决在问题生成和摘要等一至多 NLP 任务中生成多样化、语义各异序列的挑战。
- 将内容选择与序列生成解耦,实现模块化且高效的多样性控制。
- 克服离散掩码采样过程的不可微性以及内容选择中缺乏真实标签掩码的问题。
- 在保持或超越最先进性能的前提下,提升训练效率。
- 提供一种通用、与架构无关的模块,可无缝集成至任意现有编码器-解码器模型中。
提出的方法
- Selector 模块利用专家混合模型在源序列 token 上生成离散的二值掩码,每个掩码代表一种不同的内容关注点。
- 每个掩码选择源内容的不同子集,随后输入标准编码器-解码器模型,生成多样化的目标序列。
- 采用随机硬-EM(stochastic hard-EM)训练不可微的掩码采样过程,以源序列与目标序列之间的重叠作为真实掩码监督的代理信号。
- 该方法与解码策略正交,可与束搜索、采样或其他解码技术结合使用。
- 模型通过基于源-目标重叠的代理损失进行端到端训练,无需依赖标注掩码。
- 该方法支持对多个专家混合并行推理,显著降低训练时间,相较于具有多个解码器的模型具有明显优势。
实验结果
研究问题
- RQ1即插即用的内容选择模块是否能在不修改底层生成器架构的前提下,提升序列生成的多样性?
- RQ2通过二值掩码实现的显式内容选择,与通过解码策略或多个解码器实现的多样性相比,效果如何?
- RQ3当缺乏真实掩码时,基于源-目标重叠的代理信号是否能有效指导模型训练?
- RQ4将多样化过程与生成过程分离,是否能带来更高的准确率、更强的多样性以及更高的训练效率?
- RQ5专家混合方法在掩码生成方面,是否能在性能和训练速度上全面超越现有方法?
主要发现
- 所提方法在 SQuAD(问题生成)和 CNN-DM(抽象摘要)数据集上均实现了最先进(SOTA)的 top-1 准确率。
- 在两个数据集上,top-5 准确率均较之前最先进模型提升 6%。
- 训练速度比最先进混合解码器模型快 3.7 倍,每步训练时间仅为 747.6ms,而五解码器设置下的训练时间为 2367.6ms。
- 人工评估证实,该方法在多样性和准确率方面显著优于基线模型,且在问题生成与摘要任务中均具有统计显著性。
- 在 CNN-DM 数据集上,模型取得了新的 SOTA ROUGE-1 和 ROUGE-L 分数,在所有抽象摘要方法中达到最高的 BLEU-4 分数。
- 定性分析显示,不同专家生成的掩码在生成器中引发不同的注意力模式,证实了内容引导的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。