[论文解读] Towards LLM-guided Causal Explainability for Black-box Text Classifiers
本文提出了一种三步流程,利用最先进的大语言模型(LLMs)为黑箱文本分类器生成因果反事实解释。通过识别未观察到的潜在特征,将其与输入词关联,并生成最小化且语义保持不变的修改,该方法生成了高质量的反事实解释——尤其在使用 GPT-4 时表现最优,其在生成标签翻转解释方面优于其他 LLM。
With the advent of larger and more complex deep learning models, such as in Natural Language Processing (NLP), model qualities like explainability and interpretability, albeit highly desirable, are becoming harder challenges to tackle and solve. For example, state-of-the-art models in text classification are black-box by design. Although standard explanation methods provide some degree of explainability, these are mostly correlation-based methods and do not provide much insight into the model. The alternative of causal explainability is more desirable to achieve but extremely challenging in NLP due to a variety of reasons. Inspired by recent endeavors to utilize Large Language Models (LLMs) as experts, in this work, we aim to leverage the instruction-following and textual understanding capabilities of recent state-of-the-art LLMs to facilitate causal explainability via counterfactual explanation generation for black-box text classifiers. To do this, we propose a three-step pipeline via which, we use an off-the-shelf LLM to: (1) identify the latent or unobserved features in the input text, (2) identify the input features associated with the latent features, and finally (3) use the identified input features to generate a counterfactual explanation. We experiment with our pipeline on multiple NLP text classification datasets, with several recent LLMs, and present interesting and promising findings.
研究动机与目标
- 为解决黑箱文本分类器中缺乏因果可解释性的问题,这些分类器通常不透明且依赖于基于相关性的解释。
- 探索最近的指令微调 LLM 是否可作为解释器,用于识别驱动模型预测的潜在未观测特征。
- 开发一种系统性流程,通过仅修改关键输入特征来生成高质量、语义保持不变的反事实解释。
- 评估 LLM 在识别因果特征以及生成能可靠翻转模型预测的反事实解释方面的有效性。
提出的方法
- 该流程使用现成的 LLM 首先识别输入文本中可能构成模型预测基础的潜在未观测特征。
- 然后识别原始文本中与提取出的潜在特征相关的特定输入特征(例如词语或短语)。
- 通过提示 LLM 仅对识别出的输入特征进行最小化修改,以生成反事实,从而翻转分类器的标签。
- 通过在修改过程中保持原始输入的整体语境和结构,确保语义相似性。
- 该方法在多个 NLP 文本分类数据集上使用多种 LLM(包括 GPT-4、text-davinci-003 和 GPT-3.5)进行了评估。
- 评估使用 LFS(标签翻转分数)指标来衡量生成反事实并改变模型预测的成功程度。
实验结果
研究问题
- RQ1最先进的 LLM 是否能有效用于为黑箱文本分类器生成因果反事实解释?
- RQ2LLM 是否能准确识别出在文本分类中因果性影响模型预测的潜在未观测特征?
- RQ3不同 LLM(例如 GPT-4 与 GPT-3.5)在生成高质量、标签翻转且语义保持良好的反事实方面有多高效?
- RQ4潜在特征提取步骤对反事实解释整体质量的贡献是什么?
主要发现
- 在 IMDB 数据集上,GPT-4 达到了 97.2 的最高 LFS 得分,显著优于其他 LLM,表明其在生成有效反事实方面具有强大能力。
- 消融研究显示,若移除潜在特征提取步骤,性能下降至 95.78 LFS,证实该步骤在识别因果输入特征方面的重要性。
- 在涉及推理任务的 SNLI 数据集上,LLM 整体表现不佳,表明推理复杂性会影响反事实生成质量。
- 在 AG News 数据集上,GPT-3.5 和 text-davinci-003 表现较低,可能是因为任务的多类别性质增加了标签翻转提示的模糊性。
- 定性分析表明,GPT-4 提取了高质量、语义有意义的潜在特征,如“叙事连贯性”和“位置不一致”,这些特征与模型预测错误相符。
- 完整流程始终优于消融变体,表明潜在特征和输入特征识别步骤对于生成高质量反事实均至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。