[论文解读] Measuring Causal Effects of Data Statistics on Language Model's `Factual' Predictions
本文提出了一种因果推断框架,用于衡量训练数据统计特征(如共现计数)如何在不重新训练的情况下直接影响预训练语言模型(PLMs)的事实性预测。利用观察数据和do-演算,该研究证明了诸如主语-宾语共现等启发式方法会因果性地影响模型预测,其效应大小最高达57.73 CATE,揭示了PLMs依赖浅层统计特征而非深层理解的事实。
Large amounts of training data are one of the major reasons for the high performance of state-of-the-art NLP models. But what exactly in the training data causes a model to make a certain prediction? We seek to answer this question by providing a language for describing how training data influences predictions, through a causal framework. Importantly, our framework bypasses the need to retrain expensive models and allows us to estimate causal effects based on observational data alone. Addressing the problem of extracting factual knowledge from pretrained language models (PLMs), we focus on simple data statistics such as co-occurrence counts and show that these statistics do influence the predictions of PLMs, suggesting that such models rely on shallow heuristics. Our causal framework and our results demonstrate the importance of studying datasets and the benefits of causality for understanding NLP models.
研究动机与目标
- 理解并阐明训练语料库中的简单数据统计是否以及如何因果性地影响PLMs的事实性预测。
- 开发一种无需昂贵重训练即可仅从观察数据中实现因果估计的因果推断框架。
- 探究PLMs在生成答案时是否使用浅层启发式(如共现模式)而非更深层次的事实推理。
- 量化三种特定启发式方法——精确匹配(Exact-Match)、模式-宾语共现(Pattern-Object Co-occurrence)和主语-宾语共现(Subject-Object Co-occurrence)——对模型预测的因果影响。
- 为模型行为的因果分析提供方法论基础,具有可解释性和模型泛化能力的启示。
提出的方法
- 构建一个因果图,编码训练数据统计、模型权重与预测之间假设的关系。
- 应用do-演算和后门准则,从观察数据中识别并估计因果效应,避免通过重训练进行干预。
- 提出三个假设:精确匹配(记忆训练语句)、模式-宾语共现(与关系模式最常共现的宾语)和主语-宾语共现(与主语最常共现的宾语)。
- 按关系估计平均处理效应(ATE)和条件平均处理效应(CATE),以评估不同事实关系上的因果影响。
- 使用基线模型(包括始终基于启发式方法预测的Heuristic基线和理想情况下的Perfect基线)验证因果效应估计的可靠性。
- 训练一个新的RoBERTa-base模型,共84个检查点,用于分析训练动态,并向社区发布。
实验结果
研究问题
- RQ1训练数据中的共现统计在多大程度上因果性地影响PLMs的事实性预测?
- RQ2PLMs是否依赖于主语-宾语共现等浅层启发式方法,而非更深层次的语义理解?
- RQ3因果效应在不同事实关系间如何变化?效应强度差异的成因是什么?
- RQ4能否从观察数据中可靠地进行因果推断,以估计训练数据统计对模型行为的影响?
- RQ5所观察到的效应是模型学习的结果,还是仅仅是统计伪影?如何对此进行控制?
主要发现
- 主语-宾语共现对模型预测的因果效应达到57.73 CATE,表明其对事实性预测具有强烈影响。
- 模式-宾语共现假设的CATE为50.34,表明其在各类关系中均表现出显著的因果影响。
- 精确匹配假设在religion关系上的CATE为42.00,表明对训练语句的记忆在预测中起到了显著作用。
- 所有假设中最低的CATE值接近于零,表明在某些关系上,启发式方法的因果影响微乎其微。
- Heuristic基线模型的设计使其ATE达到100%,证实该框架能正确识别出由启发式驱动的行为。
- 随机初始化的模型表现出接近零的因果效应(例如,BERT-base的CATE为-2.88),证实所观察到的效应源于学习过程,而非模型初始化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。