Skip to main content
QUICK REVIEW

[论文解读] Relative Positional Encoding for Transformers with Linear Complexity

Antoine Liutkus, Ondřej Cífka|arXiv (Cornell University)|May 18, 2021
Music and Audio Processing参考文献 67被引用 14
一句话总结

本文提出随机位置编码(SPE),一种新颖方法,通过将随机噪声通过可学习滤波器来实现线性复杂度Transformer中的相对位置编码(RPE),从而在无需显式计算注意力矩阵的情况下获得类似RPE的归纳偏置。SPE可证明地模拟相关高斯过程的交叉协方差结构,并在长序列基准测试(Long-Range Arena)和音乐生成任务中表现优于正弦位置编码。

ABSTRACT

Recent advances in Transformer models allow for unprecedented sequence lengths, due to linear space and time complexity. In the meantime, relative positional encoding (RPE) was proposed as beneficial for classical Transformers and consists in exploiting lags instead of absolute positions for inference. Still, RPE is not available for the recent linear-variants of the Transformer, because it requires the explicit computation of the attention matrix, which is precisely what is avoided by such methods. In this paper, we bridge this gap and present Stochastic Positional Encoding as a way to generate PE that can be used as a replacement to the classical additive (sinusoidal) PE and provably behaves like RPE. The main theoretical contribution is to make a connection between positional encoding and cross-covariance structures of correlated Gaussian processes. We illustrate the performance of our approach on the Long-Range Arena benchmark and on music generation.

研究动机与目标

  • 解决线性复杂度Transformer变体中缺乏相对位置编码(RPE)的问题,这些模型避免计算完整的注意力矩阵。
  • 弥合RPE已知优势与线性注意力机制可扩展性之间的差距。
  • 开发一种可微分、参数高效的相对位置编码方法,模拟RPE行为而无需显式计算注意力矩阵。
  • 建立位置编码与高斯过程交叉协方差结构之间的理论联系。
  • 证明SPE可泛化RPE的优势,并在长序列建模任务中提升性能。

提出的方法

  • 提出随机位置编码(SPE)作为正弦位置编码的替代方案,利用滤波后的随机噪声生成与位置相关的查询和键。
  • 将SPE建模为使用可学习滤波器对白噪声进行滤波的过程,其中滤波噪声的交叉协方差近似于所需的RPE结构。
  • 理论基础:将SPE与相关高斯过程的交叉协方差联系起来,证明SPE可模拟任意预设的交叉协方差结构。
  • 实现两种变体:正弦SPE(SPE-S)和卷积SPE(SPE-C),后者将随机噪声与可学习滤波器进行卷积。
  • 直接将SPE集成到查询和键中,避免值中出现位置-内容交互,遵循解耦注意力范式。
  • 通过反向传播端到端训练滤波器,使模型在不计算完整注意力矩阵的情况下学习位置相关的注意力模式。

实验结果

研究问题

  • RQ1能否在避免显式计算注意力矩阵的线性复杂度Transformer中有效集成相对位置编码(RPE)?
  • RQ2是否存在一种可微分、参数高效的生成位置编码的方法,可模拟RPE的归纳偏置而无需完整注意力计算?
  • RQ3滤波后随机噪声的交叉协方差结构能否用于在注意力机制中建模RPE所需的归纳偏置?
  • RQ4SPE是否在长距离序列建模任务的性能上泛化了RPE的优势?
  • RQ5SPE能否扩展到点积注意力之外的任意注意力核,特别是在Performer等隐式核方法中?

主要发现

  • SPE通过避免显式计算注意力矩阵,成功在线性复杂度Transformer中实现了相对位置编码。
  • SPE的卷积变体(SPE-C)在Long-Range Arena基准测试中达到最先进性能,优于正弦PE和基线模型。
  • 在长序列音乐生成任务(如3,072个标记)中,SPE相比正弦PE提升了生成质量和连贯性。
  • 理论分析表明,SPE的交叉协方差结构可被调整为匹配RPE的结构,为其设计提供了严谨基础。
  • 实证结果表明,SPE在点积注意力之外也具有泛化能力,暗示其在Performer等其他隐式核方法中具有扩展潜力。
  • 在某些设置中,用SPE替代绝对位置编码可提升性能,支持RPE类归纳偏置在长序列建模中比APE更有效的观点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。