[论文解读] Learning Sparse Prototypes for Text Generation
本文提出一种基于稀疏原型的文本生成模型,通过引入诱导稀疏性的狄利克雷先验和近端变分推断,自动学习一组紧凑且高质量的原型集。该方法在保持语言建模性能的同时,相较以往的原型模型将内存使用量和推理速度分别提升了最高1000倍,并在困惑度上最高提升14个点,同时通过学习到的原型实现了可控制的、语义有意义的文本编辑。
Prototype-driven text generation uses non-parametric models that first choose from a library of sentence "prototypes" and then modify the prototype to generate the output text. While effective, these methods are inefficient at test time as a result of needing to store and index the entire training corpus. Further, existing methods often require heuristics to identify which prototypes to reference at training time. In this paper, we propose a novel generative model that automatically learns a sparse prototype support set that, nonetheless, achieves strong language modeling performance. This is achieved by (1) imposing a sparsity-inducing prior on the prototype selection distribution, and (2) utilizing amortized variational inference to learn a prototype retrieval function. In experiments, our model outperforms previous prototype-driven language models while achieving up to a 1000x memory reduction, as well as a 1000x speed-up at test time. More interestingly, we show that the learned prototypes are able to capture semantics and syntax at different granularity as we vary the sparsity of prototype selection, and that certain sentence attributes can be controlled by specifying the prototype for generation.
研究动机与目标
- 为解决原型驱动的文本生成模型在推理时需存储并索引完整训练语料库而导致的效率低下问题。
- 消除训练过程中对启发式方法进行原型选择的依赖,这些方法可能次优且不可微。
- 自动发现一个最小但影响重大的原型集合,同时仍保持强大的语言建模性能。
- 通过学习反映不同粒度下语义与句法结构的原型,实现可解释且可控制的文本生成。
- 在不牺牲生成质量的前提下提升推理时效率,尤其适用于低资源或高吞吐量场景。
提出的方法
- 提出一种生成模型,其中每个句子首先通过从潜在稀疏原型分布中采样一个原型来生成。
- 将原型分布建模为对称狄利克雷先验,以诱导稀疏性,从而在推理时减少所需原型的数量。
- 采用近端变分推断训练一个可学习的原型检索器,将输入序列映射到相关原型,替代启发式选择方法。
- 模型使用神经编辑器通过在选定原型上应用可微编辑向量来生成最终输出。
- 通过优化变分下界,联合学习原型分布与检索函数,实现端到端训练。
- 编辑向量从冯·米塞斯-费舍尔先验中采样,以实现在编辑空间中的球面插值,从而实现中间句子的平滑生成。
实验结果
研究问题
- RQ1非参数化文本生成模型是否能在大幅降低内存占用和推理时间的同时,仍实现强大的语言建模性能?
- RQ2诱导稀疏性的先验是否能自动识别出最小但有效的原型集合,而无需依赖启发式选择?
- RQ3学习到的原型在不同稀疏度水平下如何反映语义与句法结构?
- RQ4通过指定原型或编辑向量,模型是否能支持可控的文本生成?
- RQ5使用近端变分推断进行原型检索是否优于基于启发式的选择方法?
主要发现
- 所提模型相较以往基于原型的模型,内存使用量最高减少1000倍,推理速度最高提升1000倍。
- 在MSCOCO数据集上,模型相比神经语言模型基线困惑度降低1.4个点,相比先前的神经编辑器模型降低0.9个点。
- 在Yelp数据集上,模型相比神经语言模型基线困惑度最高提升14个点,相比先前的神经编辑器模型提升6个点。
- 模型在仅使用778个原型的情况下,取得了与启发式预聚类基线相当的BLEU分数(17.2),性能相当。
- 在高稀疏度(α=0.1)下,原型捕捉到通用的句法与结构模式;在较低稀疏度下,原型则反映更具体的语义内容。
- 在编辑向量空间中进行球面线性插值,可生成流畅的中间句子,实现原型之间的平滑过渡,证明了模型的可控性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。