QUICK REVIEW
[论文解读] Sequence Modeling with Unconstrained Generation Order
Dmitrii Emelianenko, Elena Voita|arXiv (Cornell University)|Nov 1, 2019
Multimodal Machine Learning Applications被引用 12
一句话总结
本文提出 INTRUS,一种神经序列模型,通过以任意顺序插入标记来生成输出序列,训练过程中学习最优生成顺序,无需预设约束。该模型在机器翻译、图像转LaTeX 和图像字幕生成任务上优于固定顺序基线模型,并学会优先生成易于预测的标记(例如标点符号、功能词)。
ABSTRACT
The dominant approach to sequence generation is to produce a sequence in some predefined order, e.g. left to right. In contrast, we propose a more general model that can generate the output sequence by inserting tokens in any arbitrary order. Our model learns decoding order as a result of its training procedure. Our experiments show that this model is superior to fixed order models on a number of sequence generation tasks, such as Machine Translation, Image-to-LaTeX and Image Captioning.
研究动机与目标
- 克服固定顺序序列生成(例如从左到右)带来的多样性与适应性限制。
- 开发一种模型,通过训练过程自动学习最优生成顺序,而无需依赖特定任务的先验知识。
- 提升在机器翻译、图像转LaTeX 和图像字幕生成等多样化序列生成任务上的性能。
- 分析模型是否学会有意义的生成顺序偏好,例如优先生成较简单的标记。
提出的方法
- 模型通过在不断增长的子序列中任意位置迭代插入标记来生成序列,表示为(位置,标记)对或 EOS。
- 采用基于 Transformer 的架构,估计在当前部分输出和输入条件下,每个插入操作的条件概率。
- 训练目标通过将概率质量集中在最可能的轨迹上,最大化参考序列的对数似然,使用真实似然的下界。
- 模型采用对最大似然目标的可微分近似,受 Vinyals 等人启发,对插入轨迹进行贪心或束搜索。
- 通过假设每个输入仅存在单一最优轨迹,避免了 O(|Y|!) 的不可行计算,实现高效的基于梯度的优化。
- 模型通过标准反向传播进行端到端训练,生成顺序无显式监督。
实验结果
研究问题
- RQ1序列模型能否在无先验归纳偏差的情况下,学习以任意非固定顺序生成?
- RQ2与固定顺序基线相比,无约束生成顺序是否能提升序列生成任务的性能?
- RQ3模型学习到的生成顺序偏好是什么类型?是否与人工标注的语言学模式一致?
- RQ4早期生成步骤是否主要由较易预测的标记主导,例如功能词或标点符号?
主要发现
- INTRUS 在机器翻译、图像转LaTeX 和图像字幕生成任务上优于从左到右和从右到左的基线模型。
- 模型学会在解码过程中优先生成标点符号和功能词(例如限定词、连词),与“先易后难”策略一致。
- 名词、形容词、介词和副词通常在上下文建立后被生成,处于过程的中段。
- 动词和助词最常在后期插入,表明模型对其预测难度较高。
- 模型根据输入自适应调整生成顺序,产生多样化模式,如从左到右、从右到左和由内而外的序列。
- 所学生成顺序并非手动指定,而是在训练中自然涌现,证明了模型发现任务特定、数据驱动策略的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。