[论文解读] CAPE: Encoding Relative Positions with Continuous Augmented Positional Embeddings
CAPE提出了一种连续的、增强的绝对位置编码方法,通过数据增强隐式编码相对位置信息,从而在机器翻译、语音识别和图像任务中提升Transformer模型的泛化能力,性能与稳定性优于标准的绝对或相对位置编码,同时保持计算效率。
Without positional information, attention-based Transformer neural networks are permutation-invariant. Absolute or relative positional embeddings are the most popular ways to feed Transformer models with positional information. Absolute positional embeddings are simple to implement, but suffer from generalization issues when evaluating on sequences longer than seen at training time. Relative positions are more robust to input length change, but are more complex to implement and yield inferior model throughput due to extra computational and memory costs. In this paper, we propose an augmentation-based approach (CAPE) for absolute positional embeddings, which keeps the advantages of both absolute (simplicity and speed) and relative positional embeddings (better generalization). In addition, our empirical evaluation on state-of-the-art models in machine translation, image and speech recognition demonstrates that CAPE leads to better generalization performance as well as increased stability with respect to training hyper-parameters.
研究动机与目标
- 解决Transformer模型在推理时序列长度超过训练长度时,绝对位置编码泛化能力受限的问题。
- 在保留相对位置编码鲁棒性的同时,克服其计算与内存开销过大的问题。
- 在不修改网络架构的前提下,提升模型在机器翻译、语音识别和图像识别等多样化任务中的稳定性与性能。
- 通过基于CAPE的新型自适应训练方案,实现在自动语音识别中无需填充的端到端训练。
- 证明通过连续增强,可显著提升可学习的绝对位置编码性能,使其达到与相对位置编码相当的水平,且复杂度更低。
提出的方法
- CAPE用连续的绝对位置编码替代离散的绝对位置编码,更好地契合视觉、音频和视频数据的连续特性。
- 训练过程中,CAPE采用一种受控的数据增强策略,对位置编码进行平移,隐式保留相对位置信息。
- 该方法采用全局平移和局部平移两种增强方式:全局平移为所有位置引入恒定偏移,局部平移则对位置施加小的随机扰动以保持相对顺序。
- 增强仅在训练阶段应用,推理阶段不引入额外开销,确保无运行时性能损失。
- 该方法不修改注意力机制,保持标准Transformer的简洁性与高效性。
- 在机器翻译中,基于语料长度统计,引入缩放因子α以对齐源序列与目标序列的位置。
实验结果
研究问题
- RQ1通过数据增强的连续位置编码是否能超越标准绝对位置编码,在Transformer中实现更好的泛化能力?
- RQ2CAPE在准确率与计算效率方面是否优于相对位置编码?
- RQ3CAPE是否可在不修改架构的前提下,有效应用于图像与语音识别等多模态任务?
- RQ4CAPE能否实现在自动语音识别中无填充训练?其性能与标准CTC或seq2seq训练相比如何?
- RQ5CAPE在超参数选择方面对模型稳定性有何影响?
主要发现
- 与标准绝对位置编码和相对位置编码相比,CAPE在机器翻译、图像识别和语音识别任务中均提升了泛化性能。
- 在机器翻译任务中,CAPE在CTC-based模型上将WER(词错误率)降低,TED-LIUM v3数据集上相对提升最高达1.5%。
- 在图像识别任务中,使用CAPE训练的单一UniViT模型能更好地泛化到未见过的图像分辨率,优于单分辨率基线模型。
- 在自动语音识别中,CAPE训练可消除对填充的依赖,实现更高效的端到端训练,且无性能损失。
- CAPE的计算开销可忽略不计——前向与反向传播无任何延迟;而相对位置编码在V100 GPU上导致2倍的延迟。
- CAPE在超参数设置下表现出更强的稳定性,尤其在初始学习率与权重衰减方面,其鲁棒性优于标准绝对位置编码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。