[论文解读] A Length-Extrapolatable Transformer
本文提出LeX Transformer,一种可扩展序列长度的注意力机制,通过新颖的相对位置嵌入(xPos)和分块因果注意力,提升长序列建模能力。通过最大化注意力分辨率并实现在训练时未见的更长序列上的稳定性能,该模型在插值和外推任务中均表现优异,在长序列语言建模任务中优于现有方法。
Position modeling plays a critical role in Transformers. In this paper, we focus on length extrapolation, i.e., training on short texts while evaluating longer sequences. We define attention resolution as an indicator of extrapolation. Then we propose two designs to improve the above metric of Transformers. Specifically, we introduce a relative position embedding to explicitly maximize attention resolution. Moreover, we use blockwise causal attention during inference for better resolution. We evaluate different Transformer variants with language modeling. Experimental results show that our model achieves strong performance in both interpolation and extrapolation settings. The code will be available at https://aka.ms/LeX-Transformer.
研究动机与目标
- 解决Transformer在泛化到训练时未见的更长序列长度方面的关键局限性。
- 定义并优化一个度量——注意力分辨率,用于量化模型外推至更长序列的能力。
- 设计一种相对位置嵌入(xPos),在长上下文中保持高分辨率与稳定性,优于RoPE和Alibi。
- 在不牺牲短序列性能或无需微调的情况下,实现在长序列上的优异表现。
- 证明分块因果注意力可提升分辨率,并在自回归语言建模中支持外推。
提出的方法
- 提出xPos,一种源自RoPE的相对位置嵌入,通过在旋转矩阵中引入指数衰减进行泛化,以提升注意力分辨率。
- 将注意力分辨率定义为量化度量,用于衡量模型在长序列中保持位置区分能力的程度。
- 在推理阶段引入分块因果注意力(BCA),通过限制注意力仅作用于局部块,同时保持长距离依赖建模能力,从而提升分辨率。
- 采用改进的自注意力机制,其中查询-键交互通过xPos嵌入进行调整,以高保真度编码相对位置。
- 采用通用设计原则,确保顺序变异性与平移不变性,从而在输入长度变化时保持鲁棒性。
- 使用标准密集注意力从头开始训练模型,预训练阶段保留标准长度输入的效率与性能。
实验结果
研究问题
- RQ1能否设计一种相对位置嵌入,使其在极长序列中保持高注意力分辨率,从而实现对训练长度之外的外推?
- RQ2分块因果注意力如何影响长序列语言建模中的注意力分辨率与性能?
- RQ3所提出的xPos嵌入在短序列与长序列设置下是否均优于RoPE与Alibi?
- RQ4在不进行微调或架构修改的情况下,仅在短序列上训练的模型能否有效泛化到极长序列?
- RQ5所提方法在提升外推能力的同时,推理成本的权衡如何?
主要发现
- LeX Transformer在预训练的验证集上达到最小困惑度,表明其在分布内性能极强。
- 在arXiv数据集上(平均长度>6k),LeX Transformer随着序列长度增加,困惑度持续降低,而其他模型则趋于平缓或上升。
- 与未使用分块因果注意力的相同模型相比,xPos在2048 token时将困惑度降低约1,在4096 token时降低约8。
- 分块因果注意力对RoPE-based模型至关重要,可避免长序列下的困惑度爆炸,但对Alibi而言影响较小,因其本身具有软注意力窗口特性。
- 模型在标准长度序列上保持强大性能,未表现出短序列与长序列能力之间的权衡。
- xPos相比绝对位置嵌入仅引入约6%的额外推理成本,且训练收敛速度更快。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。