[论文解读] Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space
本文揭示,Transformer语言模型中的前馈网络(FFN)层通过在词汇空间中对标记表示应用加法更新来构建预测,其中每个更新对应一个可被人类理解的概念(例如‘代词’或‘早餐’)。通过将FFN输出分解为由单个参数向量驱动的子更新,作者实现了可解释性,使GPT-2的毒性降低近50%,并通过早期退出规则实现20%的计算节省。
Transformer-based language models (LMs) are at the core of modern NLP, but their internal prediction construction process is opaque and largely not understood. In this work, we make a substantial step towards unveiling this underlying prediction process, by reverse-engineering the operation of the feed-forward network (FFN) layers, one of the building blocks of transformer models. We view the token representation as a changing distribution over the vocabulary, and the output from each FFN layer as an additive update to that distribution. Then, we analyze the FFN updates in the vocabulary space, showing that each update can be decomposed to sub-updates corresponding to single FFN parameter vectors, each promoting concepts that are often human-interpretable. We then leverage these findings for controlling LM predictions, where we reduce the toxicity of GPT2 by almost 50%, and for improving computation efficiency with a simple early exit rule, saving 20% of computation on average.
研究动机与目标
- 理解基于Transformer的语言模型中前馈网络(FFN)层如何参与预测构建。
- 解决FFN操作的不透明性,其作为现代NLP模型中关键但研究不足的组件。
- 开发一种方法,将FFN更新解释为输出词汇空间中促进特定概念的机制。
- 通过子更新操控实现实际应用,如毒性缓解和计算效率提升。
- 提供一种细粒度控制和可解释性框架,针对单个FFN参数向量的内部机制。
提出的方法
- 将FFN输出重新表述为对标记表示的加法更新,将表示视为词汇表上的分布。
- 将每个FFN更新分解为对应于第二个FFN矩阵中各个列(向量)的子更新,这些向量被称为‘值向量’。
- 将每个值向量解释为在词汇空间中促进特定、人类可理解的概念,通过人工标注进行验证。
- 将预测过程建模为一系列促进概念的更新序列,最终输出分布由累积的子更新效应生成。
- 利用主导子更新作为早期退出的信号,通过预测何时达到足够置信度来减少计算量。
- 通过修改特定值向量的权重实施干预,引导模型生成朝向期望行为(例如降低毒性)。
实验结果
研究问题
- RQ1Transformer模型中的FFN层如何在输出词汇空间中参与最终预测的构建?
- RQ2单个FFN参数向量(值向量)是否可被解释为促进特定、人类可理解的概念?
- RQ3FFN更新在多大程度上依赖于促进高概率标记,而非抑制低概率标记?
- RQ4能否利用FFN层的子更新来控制模型行为,例如降低生成文本中的毒性?
- RQ5主导子更新能否作为早期退出的可靠信号,从而提高推理的计算效率?
主要发现
- FFN层对标记表示施加加法更新,可被解释为在输出词汇表上的概率分布发生偏移。
- 每个FFN更新可分解为由单个值向量驱动的子更新,每个子更新促进一个独特且人类可理解的概念,如‘代词’或‘早餐’。
- 预测过程主要由标记促进主导:输出中高概率的标记是那些受到多个子更新强烈影响的标记。
- 仅在GPT-2中修改10个子更新的权重,即可使生成文本的毒性降低近50%。
- 主导子更新提供了强有力的早期退出信号,可实现平均20%的计算量减少,且准确率损失不显著。
- 单个值向量的可解释性高于其组合,表明单独分析它们是模型可解释性研究的有前景的第一步。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。