[论文解读] Transformer Language Models without Positional Encodings Still Learn Positional Information
该论文表明,尽管没有显式的位置编码,因果注意力机制仍使因果Transformer语言模型隐式地学习到绝对位置信息,从而在不同模型规模、数据集和序列长度下表现出具有竞争力的性能。作者证明,因果掩码使模型能够通过计算可关注的前驱标记数量来推断标记位置,解释了为何NoPos模型在缺乏位置编码时仍优于双向模型。
Causal transformer language models (LMs), such as GPT-3, typically require some form of positional encoding, such as positional embeddings. However, we show that LMs without any explicit positional encoding are still competitive with standard models, and that this phenomenon is robust across different datasets, model sizes, and sequence lengths. Probing experiments reveal that such models acquire an implicit notion of absolute positions throughout the network, effectively compensating for the missing information. We conjecture that causal attention enables the model to infer the number of predecessors that each token can attend to, thereby approximating its absolute position. Our findings indicate that causal LMs might derive positional awareness not only from the explicit positioning mechanism, but also from the effects of the causal mask.
研究动机与目标
- 探究Transformer语言模型是否能在没有显式位置编码的情况下学习位置信息。
- 评估NoPos模型在不同模型规模、数据集和序列长度下的鲁棒性。
- 分析NoPos模型的隐藏表示中是否会出现隐式的方位意识。
- 确定因果注意力机制是否负责隐式的位置学习。
- 对比在缺乏位置编码时,自回归(因果)模型与双向(掩码)模型的行为差异。
提出的方法
- 训练无任何位置编码的Transformer语言模型(NoPos),并与使用正弦、可学习及ALiBi位置编码的模型进行比较。
- 使用探测分类器从不同网络层的隐藏表示中预测标记位置。
- 通过WikiText-103和大规模Pile语料库片段的验证集困惑度来衡量性能。
- 对掩码语言模型(MLMs)进行消融研究,以测试双向注意力在无显式编码时是否能学习位置信息。
- 分析注意力模式,评估因果掩码是否使模型能够推断前驱标记的数量。
- 在多个模型规模(125M至1.3B参数)和序列长度(最高512个标记)下评估模型行为。
实验结果
研究问题
- RQ1Transformer语言模型是否能在没有显式位置编码的情况下学习绝对位置信息?
- RQ2因果注意力机制是否使自回归模型能够实现隐式的位置学习?
- RQ3NoPos模型在不同数据集和模型规模下与位置感知模型的性能相比如何?
- RQ4为何双向掩码语言模型在缺乏显式位置编码时无法学习位置信息?
- RQ5NoPos模型的隐藏表示在多大程度上能准确预测标记的真实位置?
主要发现
- NoPos模型在多个数据集和模型规模下,其困惑度得分与使用可学习、正弦或ALiBi位置编码的模型相当。
- 探测实验表明,NoPos模型学习到了有意义的绝对位置表示,其平均绝对预测误差与使用可学习位置嵌入的模型相近。
- 因果注意力掩码使模型能够隐式推断前驱标记的数量,从而有效近似绝对位置。
- 当缺乏位置编码时,双向掩码语言模型无法收敛,表明因果注意力对隐式位置学习至关重要。
- 随着模型规模增大,NoPos模型与位置感知模型之间的性能差距缩小,表明更大的模型可能对显式位置归纳偏置的依赖性降低。
- NoPos模型在Pile语料库上训练的验证困惑度为17.8,而最佳基线模型为17.6,表明尽管无显式位置编码,其性能仍近乎相等。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。