[论文解读] Amnesic Probing: Behavioral Explanation with Amnesic Counterfactuals
本文提出了一种反事实方法——遗忘探针(Amnesic Probing),通过从表征中移除特定语言属性(如词性)并测量其行为影响,评估神经语言模型如何利用这些属性。与仅检测信息存在的标准探针不同,遗忘探针揭示出高探针准确率并不意味着任务相关性——例如,BERT 的掩码语言建模任务中,词性信息虽常被编码,但并未被实际使用。
A growing body of work makes use of probing to investigate the working of neural models, often considered black boxes. Recently, an ongoing debate emerged surrounding the limitations of the probing paradigm. In this work, we point out the inability to infer behavioral conclusions from probing results and offer an alternative method that focuses on how the information is being used, rather than on what information is encoded. Our method, Amnesic Probing, follows the intuition that the utility of a property for a given task can be assessed by measuring the influence of a causal intervention that removes it from the representation. Equipped with this new analysis tool, we can ask questions that were not possible before, e.g. is part-of-speech information important for word prediction? We perform a series of analyses on BERT to answer these types of questions. Our findings demonstrate that conventional probing performance is not correlated to task importance, and we call for increased scrutiny of claims that draw behavioral or causal conclusions from probing results.
研究动机与目标
- 为解决标准探针在推断模型如何使用编码信息时的行为或因果结论方面的局限性。
- 开发一种方法,评估语言属性对模型行为的实际影响,而非仅检测其在表征中的存在。
- 探究诸如词性与依存标签等常见探针语言属性是否在掩码语言建模等任务中具有功能重要性。
- 比较 BERT 在掩码与非掩码设置下对语言信息的使用方式,揭示其在属性利用上的显著差异。
- 通过反事实干预分析各层贡献,重新评估关于 BERT 内部处理的先前主张。
提出的方法
- 遗忘探针通过迭代零空间投影(INLP)从上下文表征中移除特定语言属性(如词性)来执行反事实干预。
- 该方法通过在信息擦除后评估模型在下游任务(如掩码语言建模)上的预测性能,来度量移除行为的影响。
- 采用两阶段流程:首先,探针识别表征空间中语言属性的方向;其次,INLP 将表征投影到该方向的零空间中,以中和其影响。
- 通过比较干预前后预测准确率的变化,评估被移除属性对任务的实用性。
- 该方法可分析粗粒度属性(如词性)及细粒度子类型(如名词、限定词)在不同 BERT 层和输入设置下的表现。
- 该方法应用于 BERT 的掩码与非掩码设置,以比较不同训练与推理范式下语言信息的使用方式。
实验结果
研究问题
- RQ1对于语言属性(如词性)的高探针准确率在多大程度上表明模型实际在预测中使用了该信息?
- RQ2在 BERT 的掩码与非掩码输入设置下,语言属性的行为影响有何不同?
- RQ3哪些具体语言属性子类型(如名词或限定词等词性)对词语预测的影响最大?
- RQ4BERT 的不同层如何利用语言信息?哪些层对特定属性的移除最为敏感?
- RQ5与标准探针相比,遗忘探针能否提供更可靠的因果归因,以解释语言特征对模型行为的影响?
主要发现
- 对于词性等语言属性的高探针准确率,并不与掩码语言建模中的实际行为重要性相关,挑战了对探针结果的常见解释。
- 通过遗忘探针移除词性信息后,掩码语言建模性能出现显著下降,表明 BERT 实际上在预测中功能化地使用了词性信息。
- 语言属性在掩码与非掩码设置下的使用方式不同:BERT 在掩码设置下更依赖句法与形态特征,而在非掩码输入中对这些特征的依赖程度降低。
- 细粒度分析表明,并非所有词性都具有同等影响力——限定词与代词对预测的影响强于形容词或副词等其他词性。
- 分层分析显示,BERT 的早期层对语言属性的移除更为敏感,表明其在句法与形态处理中起关键作用。
- 该方法揭示,即使在遗忘干预后,部分表征仍保持高探针准确率,表明即使经过线性中和,仍可能存在虚假相关性或非线性编码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。