[论文解读] In-Context Explainers: Harnessing LLMs for Explaining Black Box Models
本文提出了首个利用上下文学习(ICL)技术,将大型语言模型(LLMs)作为黑箱机器学习模型事后解释器的框架。该研究提出了四种提示策略——基于扰动的ICL、基于预测的ICL、基于指令的ICL以及基于解释的ICL,实验证明LLMs在识别导致预测结果的最关键特征方面达到了72.19%的准确率,与当前最先进解释方法相当,且无需微调,仅需少量 few-shot 示例即可实现。
Recent advancements in Large Language Models (LLMs) have demonstrated exceptional capabilities in complex tasks like machine translation, commonsense reasoning, and language understanding. One of the primary reasons for the adaptability of LLMs in such diverse tasks is their in-context learning (ICL) capability, which allows them to perform well on new tasks by simply using a few task samples in the prompt. Despite their effectiveness in enhancing the performance of LLMs on diverse language and tabular tasks, these methods have not been thoroughly explored for their potential to generate post hoc explanations. In this work, we carry out one of the first explorations to analyze the effectiveness of LLMs in explaining other complex predictive models using ICL. To this end, we propose a novel framework, In-Context Explainers, comprising of three novel approaches that exploit the ICL capabilities of LLMs to explain the predictions made by other predictive models. We conduct extensive analysis with these approaches on real-world tabular and text datasets and demonstrate that LLMs are capable of explaining other predictive models similar to state-of-the-art post hoc explainers, opening up promising avenues for future research into LLM-based post hoc explanations of complex predictive models.
研究动机与目标
- 探究LLMs是否能够在不进行模型微调或无需白盒访问的情况下,作为黑箱模型的可靠事后解释器。
- 开发并评估一种利用上下文学习(ICL)生成忠实、人类可理解解释的新框架,用于模型预测。
- 将LLM生成的解释与最先进的事后解释方法(如LIME和SHAP)在忠实度和准确性方面进行比较。
- 分析提示设计、ICL样本数量以及LLM架构(如GPT-3.5与GPT-4)对解释质量的影响。
- 建立一个用于评估可解释人工智能(XAI)中基于LLM的解释框架的基准。
提出的方法
- 提出四种不同的上下文学习(ICL)提示策略:基于扰动的ICL、基于预测的ICL、基于指令的ICL以及基于解释的ICL,其区别在于提供关于局部邻域和模型行为信息的程度不同。
- 使用真实世界基准数据集和两种黑箱模型(如逻辑回归)来评估LLM生成的解释。
- 采用一系列忠实度度量指标——忠实度(FA)、表征准确率(RA)和预测梯度重要性(PGI)——对解释质量进行定量评估。
- 采用GPT-3.5和GPT-4作为LLM骨干模型,比较其在不同提示策略和超参数设置下的性能表现。
- 通过消融研究分析ICL样本数量、扰动格式和温度超参数的影响,以评估其敏感性及最优配置。
- 引入实用函数和解析工具,以在框架内实现基于LLM的解释提取与评估的标准化。

实验结果
研究问题
- RQ1LLMs是否能够通过上下文学习在不进行微调的情况下,有效生成黑箱模型的事后解释?
- RQ2LLM生成的解释性能与最先进的事后解释器(如LIME和基于梯度的方法)相比如何?
- RQ3增加上下文示例数量对LLM生成解释的忠实度有何影响?
- RQ4不同提示策略(如基于指令的与基于扰动的)如何影响解释的忠实度和准确性?
- RQ5LLM架构的选择(如GPT-3.5与GPT-4)是否显著影响生成解释的质量?
主要发现
- LLMs在四个基准数据集和两种黑箱模型上,平均达到72.19%的准确率(top-k=1),成功识别出最关键特征,表明其作为事后解释器具有强大性能。
- 基于解释的ICL通过提供少量输入-输出-解释三元组示例,使LLMs仅用四个上下文示例即可模仿六种最先进的解释器行为。
- GPT-4在所有指标上均优于GPT-3.5,在Adult数据集上忠实度(FA)高出4.53%,表征准确率(RA)高出48.01%,归因于其更强的推理能力。
- 当上下文示例数量超过少量样本(如64个)后,解释的忠实度反而下降,表明过长的提示会损害LLMs检索相关信息的能力。
- LLM生成解释的忠实度对提示设计敏感:将扰动前后样本的差异作为输入可提升性能,而高温值对输出质量影响微乎其微。
- 基于指令的ICL在表征准确率(RA)方面优于基于扰动和基于预测的ICL,表明清晰、结构化的指令可增强解释的忠实度。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。