[论文解读] Joint Source-Target Self Attention with Locality Constraints
本文提出一种联合源-目标自注意力Transformer架构,采用局部注意力窗口,消除了对独立编码器-解码器组件的需求。通过将源序列和目标序列拼接后作为因果语言模型进行训练,并施加感受野约束,该模型在IWSLT’14德英翻译任务上取得了35.7 BLEU的新SOTA结果,相比之前方法至少提升了0.5 BLEU点。
The dominant neural machine translation models are based on the encoder-decoder structure, and many of them rely on an unconstrained receptive field over source and target sequences. In this paper we study a new architecture that breaks with both conventions. Our simplified architecture consists in the decoder part of a transformer model, based on self-attention, but with locality constraints applied on the attention receptive field. As input for training, both source and target sentences are fed to the network, which is trained as a language model. At inference time, the target tokens are predicted autoregressively starting with the source sequence as previous tokens. The proposed model achieves a new state of the art of 35.7 BLEU on IWSLT'14 German-English and matches the best reported results in the literature on the WMT'14 English-German and WMT'14 English-French translation benchmarks.
研究动机与目标
- 探索一种简化神经机器翻译架构,将编码器与解码器合并为单一的Transformer解码器模块。
- 研究在自注意力中施加局部性约束是否能提升翻译性能,同时保持联合源-目标表征学习能力。
- 评估联合源-目标自注意力模型是否能在不使用显式编码器-解码器注意力机制的情况下超越现有SOTA结果。
- 确定局部注意力窗口是否能增强低资源翻译场景(如IWSLT’14)下的泛化能力与效率。
- 验证仅通过自注意力与因果掩码从拼接的源-目标序列中学习联合表征的有效性。
提出的方法
- 该模型采用标准Transformer解码器架构,包含多头自注意力机制,但通过施加局部性约束,将每层的注意力感受野限制在固定窗口大小内。
- 源序列与目标序列被拼接并作为单一输入序列输入模型,源段与目标段分别使用独立的位置嵌入和语言特定的词嵌入。
- 模型以因果语言模型的方式训练,自回归地预测目标词元,条件是完整的源序列和先前生成的目标词元。
- 局部注意力通过将每个头的注意力范围限制在每个词元周围的滑动窗口内实现,窗口大小从输入层到输出层逐步增大。
- 位置嵌入使用正弦函数初始化,语言嵌入则在训练过程中学习,以区分源段与目标段。
- 该架构采用Adam优化器进行端到端训练,学习率采用线性预热与余弦退火调度,批量大小与训练步数根据数据集进行调优。
实验结果
研究问题
- RQ1无显式编码器-解码器结构的联合源-目标自注意力模型能否实现具有竞争力或更优的翻译性能?
- RQ2在自注意力中施加局部性约束是否能提升翻译质量,特别是在IWSLT’14等低资源设置下?
- RQ3在标准基准上,局部化联合自注意力模型与无约束版本及现有SOTA模型相比性能如何?
- RQ4从拼接序列中学习的联合源-目标表征在多大程度上提升了泛化能力与模型容量?
- RQ5所提出的架构能否在WMT基准上匹配或超越如Dynamic Convolutions和Transformer变体等SOTA模型的性能?
主要发现
- 所提出的局部联合自注意力模型在IWSLT’14德英翻译基准上取得了35.7 BLEU的新SOTA结果,相比之前最佳结果至少提升了0.5 BLEU点。
- 在IWSLT’14德英任务上,加入局部性约束的模型相比无约束的联合自注意力基线提升了0.4 BLEU点,表明在低资源场景下局部注意力具有显著优势。
- 在WMT’14英德基准上,该模型达到了文献中报告的最佳结果,BLEU得分为28.5,与先前SOTA模型保持一致。
- 在WMT’14英法任务上,该模型取得了43.3的新SOTA BLEU得分,优于以往结果,并与Wu et al. (2019) 和Ott et al. (2018) 报告的最佳分数相当。
- 局部性约束在大规模WMT基准上未显著提升性能,但在低资源设置下提供了显著增益,表明其在数据稀缺场景下具有强大的归纳偏置。
- 无显式编码器-解码器结构的联合自注意力模型实现了具有竞争力的性能,验证了通过自注意力实现联合源-目标表征学习的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。