[论文解读] Faithful Explanations of Black-box NLP Models Using LLM-generated Counterfactuals
本文提出了两种与模型无关的方法,利用大语言模型(LLM)生成的反事实样例,实现对黑箱NLP模型的忠实、因果性解释:(1)直接基于LLM的反事实生成方法;(2)在训练过程中由LLM生成的反事实样例引导的快速、高效匹配方法。该匹配方法学习了一个保持与因果图一致性的因果嵌入空间,在结合Top-K技术时,性能优于多种基线方法,尤其在匹配和生成场景中表现突出。
Causal explanations of the predictions of NLP systems are essential to ensure safety and establish trust. Yet, existing methods often fall short of explaining model predictions effectively or efficiently and are often model-specific. In this paper, we address model-agnostic explanations, proposing two approaches for counterfactual (CF) approximation. The first approach is CF generation, where a large language model (LLM) is prompted to change a specific text concept while keeping confounding concepts unchanged. While this approach is demonstrated to be very effective, applying LLM at inference-time is costly. We hence present a second approach based on matching, and propose a method that is guided by an LLM at training-time and learns a dedicated embedding space. This space is faithful to a given causal graph and effectively serves to identify matches that approximate CFs. After showing theoretically that approximating CFs is required in order to construct faithful explanations, we benchmark our approaches and explain several models, including LLMs with billions of parameters. Our empirical results demonstrate the excellent performance of CF generation models as model-agnostic explainers. Moreover, our matching approach, which requires far less test-time resources, also provides effective explanations, surpassing many baselines. We also find that Top-K techniques universally improve every tested method. Finally, we showcase the potential of LLMs in constructing new benchmarks for model explanation and subsequently validate our conclusions. Our work illuminates new pathways for efficient and accurate approaches to interpreting NLP systems.
研究动机与目标
- 为解决黑箱NLP模型缺乏忠实、与模型无关的解释问题,通过因果推理来构建解释。
- 克服现有方法将相关性误认为因果性的局限,尤其是在存在混杂概念的情况下。
- 在保持解释忠实性的同时,降低基于LLM的反事实生成的高推理成本。
- 开发一种训练时方法,学习一个与给定因果图一致的因果表示空间,以实现在推理阶段的高效匹配。
- 证明LLM可用于构建高质量、可扩展的基准数据集,用于评估模型解释方法。
提出的方法
- 提出一种反事实生成方法:通过提示LLM修改文本中的特定概念,同时保持混杂概念不变,从而生成忠实的反事实样例。
- 引入一种基于匹配的方法,利用对比损失学习因果表示空间,训练数据包括LLM生成的反事实样例和有效匹配对。
- 利用因果图定义满足后门准则的调整变量,确保在反事实近似中实现有效的混杂因子控制。
- 采用对比目标训练表示模型:查询样本与反事实/匹配样本的表示应相似,与错误匹配样本的表示应不同。
- 在所有方法中应用Top-K技术以提升鲁棒性与性能,尤其在匹配和生成设置中效果显著。
- 在训练阶段利用GPT-4生成高质量反事实样例并识别有效匹配,从而实现在测试阶段无需LLM推理的高效推理。
实验结果
研究问题
- RQ1LLM生成的反事实样例能否作为黑箱NLP模型的最先进、与模型无关的解释方法?
- RQ2如何在不依赖测试阶段昂贵LLM推理的前提下,实现忠实、因果性的解释?
- RQ3学习到的嵌入空间能否保持因果忠实性,并实现高效、准确的反事实匹配?
- RQ4Top-K技术在多大程度上提升了反事实解释方法的性能?
- RQ5LLM能否被有效用于构建可扩展、高质量的基准数据集,以评估模型解释方法?
主要发现
- 基于LLM的反事实生成在作为与模型无关的解释器时达到最先进性能,展现出对因果效应的高度忠实性。
- 所提出的匹配方法避免了测试阶段的LLM推理,其速度最高可达生成方法的1000倍,且仍优于多个强基线方法。
- Top-K技术普遍提升了所有评估方法的性能,显著增强了鲁棒性与准确性。
- 学习到的因果嵌入空间能有效识别有效的反事实近似,保持与底层因果图的一致性。
- LLM可被有效用于生成高质量、可扩展的基准数据集,以支持模型解释评估,减少对昂贵人工标注的依赖。
- 实证结果验证了近似反事实样例对于忠实解释的必要性,且非因果方法常因混杂偏差而失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。