Skip to main content
QUICK REVIEW

[论文解读] Linearity of Relation Decoding in Transformer Language Models

Evan Hernandez, Arnab Sen Sharma|arXiv (Cornell University)|Aug 17, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本文研究了变换器语言模型如何编码和解码关系知识,发现对于48%的测试关系(如“演奏乐器”或“有颜色”),这种知识可通过作用于主体表征的线性变换(LRE)良好近似。该方法通过单个提示直接估计模型雅可比矩阵中的线性关系,实现了可解释的知识编辑与可视化,借助“属性透镜”可揭示即使在生成错误输出时仍隐藏的事实知识。

ABSTRACT

Much of the knowledge encoded in transformer language models (LMs) may be expressed in terms of relations: relations between words and their synonyms, entities and their attributes, etc. We show that, for a subset of relations, this computation is well-approximated by a single linear transformation on the subject representation. Linear relation representations may be obtained by constructing a first-order approximation to the LM from a single prompt, and they exist for a variety of factual, commonsense, and linguistic relations. However, we also identify many cases in which LM predictions capture relational knowledge accurately, but this knowledge is not linearly encoded in their representations. Our results thus reveal a simple, interpretable, but heterogeneously deployed knowledge representation strategy in transformer LMs.

研究动机与目标

  • 探究变换器语言模型中的关系知识是否通过主体表征的线性变换进行编码。
  • 确定是否可使用单个提示可靠估计线性关系嵌入(LRE),以捕捉不同主体下关系的对象预测。
  • 评估LRE在编辑模型行为和可视化隐藏事实知识方面的适用程度。
  • 将LRE与随机基线进行比较,并评估其在不同类型关系上的鲁棒性。
  • 开发并验证一种“属性透镜”可视化工具,以揭示模型在何时何地检索特定关系事实。

提出的方法

  • 作者通过计算模型输出对单个提示中主体表征的雅可比矩阵,估计线性关系嵌入(LRE),近似模型的一阶行为。
  • 针对每种关系,他们训练一个线性探测器(W_r, b_r),将主体表征映射到对象表征,使用少量主体-对象对。
  • 通过测量预测的对象分布与模型中实际的下一个词分布的匹配程度,验证LRE的有效性。
  • 他们引入一种“属性透镜”可视化方法,将每一层的隐藏表征通过估计的LRE进行投影,展示在每一层上给定关系的对象词分布。
  • 他们在GPT和LLaMA模型上对47种关系进行了LRE评估,涵盖事实性、常识性及偏见性关系,使用单个词和多个词的补全方式。
  • 通过使用LRE编辑主体表征并测量模型输出的变化,评估其因果效应。

实验结果

研究问题

  • RQ1变换器语言模型中的关系知识在多大程度上被编码为对主体表征的线性变换?
  • RQ2是否可使用单个提示可靠估计线性关系嵌入(LRE),以捕捉不同主体下关系的对象预测?
  • RQ3LRE在预测各种关系的正确对象词方面,与随机基线相比表现如何?
  • RQ4当LRE失效时,模型可能使用何种替代机制来编码和检索关系知识?
  • RQ5LRE能否用于可视化和检测模型中的隐藏事实知识,即使模型生成了错误输出?

主要发现

  • 在测试的47种关系中,48%的关系,线性关系嵌入(LRE)能对模型的关系解码过程提供稳健且忠实的近似。
  • 从单个提示中估计的LRE能准确预测多样化主体的对象词,其性能显著优于随机基线。
  • 属性透镜可视化方法成功揭示了隐藏的事实知识(如挪威的首都),即使模型生成了错误输出(如“伦敦”)。
  • LRE可用于以因果方式编辑主体表征,从而改变模型输出,证明其在模型控制中的可解释性与实用性。
  • 本研究识别出一种异质性的知识表征策略:部分关系以线性方式编码,而其他关系则依赖更复杂的非线性机制,表明线性并非普遍适用。
  • 该方法揭示,与较易或较难的随机基线相关的关系,分别更易或更难被LRE近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。