Skip to main content
QUICK REVIEW

[论文解读] Inductive Biases and Variable Creation in Self-Attention Mechanisms

Benjamin Edelman, Surbhi Goel|arXiv (Cornell University)|Oct 19, 2021
Topic Modeling参考文献 45被引用 15
一句话总结

本文证明了Transformer中的自注意力机制表现出强烈的归纳偏置,倾向于学习稀疏函数——具体而言,它们能以与上下文长度 $T$ 的对数成比例的样本复杂度表示 $s$-稀疏布尔函数。其关键理论贡献是基于范数的泛化界,利用覆盖数方法,表明有界范数的注意力头在学习稀疏交互时可实现低样本复杂度,从而解释了其在建模长距离依赖关系时为何不易过拟合。

ABSTRACT

Self-attention, an architectural motif designed to model long-range interactions in sequential data, has driven numerous recent breakthroughs in natural language processing and beyond. This work provides a theoretical analysis of the inductive biases of self-attention modules. Our focus is to rigorously establish which functions and long-range dependencies self-attention blocks prefer to represent. Our main result shows that bounded-norm Transformer networks "create sparse variables": a single self-attention head can represent a sparse function of the input sequence, with sample complexity scaling only logarithmically with the context length. To support our analysis, we present synthetic experiments to probe the sample complexity of learning sparse Boolean functions with Transformers.

研究动机与目标

  • 对Transformer中自注意力机制的归纳偏置进行形式化分析。
  • 识别自注意力机制偏好表示的函数类型及长距离依赖关系的特征。
  • 建立使用注意力模块学习稀疏函数的样本复杂度的理论边界。
  • 将基于范数的泛化理论与自注意力头的表征能力联系起来。
  • 通过在稀疏布尔函数上进行合成实验验证理论。

提出的方法

  • 利用 $\ell_{\infty}$ 矩阵范数推导出自注意力机制的基于覆盖数的容量边界,从而实现基于范数的泛化边界。
  • 将现有线性函数类的覆盖数边界(Zhang, 2002)的结论应用于注意力头容量分析。
  • 证明有界范数的注意力头可使用权重范数 $2^{O(s)}$ 或对称情况下 $\mathrm{poly}(s)$ 表示 $s$-稀疏函数。
  • 设计合成实验,训练Transformer在可变长度序列上识别随机选择的 $s$-稀疏布尔函数。
  • 采用固定采样和独立同分布采样两种协议,以探测样本效率和计算行为。
  • 通过理论边界和实证验证,分析注意力机制在统计和表征能力上的极限。

实验结果

研究问题

  • RQ1自注意力机制在表征函数时偏好哪些类型,特别是从稀疏性角度?
  • RQ2在自注意力模型中,学习稀疏函数的样本复杂度如何随上下文长度 $T$ 变化?
  • RQ3有界范数的自注意力头能否高效表示 $s$-稀疏函数?其所需的范数缩放关系如何?
  • RQ4自注意力机制的统计容量(以覆盖数和泛化边界衡量)是多少?
  • RQ5尽管存在理论挑战,为何Transformer仍能学习最难的 $s$-稀疏函数(如XOR(奇偶性)函数)?

主要发现

  • 自注意力头表现出对学习稀疏函数的归纳偏置,样本复杂度随上下文长度 $T$ 呈 $\log(T)$ 的增长。
  • 有界范数的注意力头可使用权重范数 $2^{O(s)}$ 表示 $s$-稀疏函数,对称情况下为 $\mathrm{poly}(s)$。
  • 理论分析表明,基于覆盖数的自注意力机制泛化边界随 $T$ 对数增长,支持低样本复杂度。
  • 合成实验确认,Transformer学习稀疏布尔函数的样本复杂度与预测的 $\log(T)$ 缩放一致。
  • 尽管存在理论挑战,Transformer仍成功学习最难的 $s$-稀疏函数——XOR(奇偶性)函数,表明其计算能力超越了当前统计分析的范畴。
  • 结果为自注意力模型在长距离依赖关系上泛化良好且不易过拟合提供了正式的统计基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。