[论文解读] Model-agnostic and Scalable Counterfactual Explanations via Reinforcement Learning
本文提出了一种模型无关的、基于强化学习的框架,可在单次前向传播中生成稀疏且分布内(in-distribution)的反事实解释,支持批量处理、目标与特征条件化,并适用于表格数据和图像数据。该方法在不进行每实例迭代优化的情况下,实现了与最先进基线方法相当的性能。
Counterfactual instances are a powerful tool to obtain valuable insights into automated decision processes, describing the necessary minimal changes in the input space to alter the prediction towards a desired target. Most previous approaches require a separate, computationally expensive optimization procedure per instance, making them impractical for both large amounts of data and high-dimensional data. Moreover, these methods are often restricted to certain subclasses of machine learning models (e.g. differentiable or tree-based models). In this work, we propose a deep reinforcement learning approach that transforms the optimization procedure into an end-to-end learnable process, allowing us to generate batches of counterfactual instances in a single forward pass. Our experiments on real-world data show that our method i) is model-agnostic (does not assume differentiability), relying only on feedback from model predictions; ii) allows for generating target-conditional counterfactual instances; iii) allows for flexible feature range constraints for numerical and categorical attributes, including the immutability of protected features (e.g. gender, race); iv) is easily extended to other data modalities such as images.
研究动机与目标
- 解决现有反事实生成方法计算效率低下的问题,这些方法需要对每个实例进行迭代优化。
- 开发一种仅依赖模型预测反馈、无需梯度或模型特定修改的模型无关框架。
- 实现目标条件化和特征约束的反事实生成,包括不可变特征或取值范围受限的特征(例如性别、年龄、教育水平)。
- 将该方法扩展至高维数据模态(如图像),且仅需极少的架构修改。
- 实现在不牺牲有效性或分布内质量的前提下,快速、可扩展的反事实生成。
提出的方法
- 通过在输入特征上采取动作以最小化结合了稀疏性、有效性和分布内目标的奖励函数,训练一个深度强化学习智能体来生成反事实实例。
- 智能体使用条件向量引导生成过程,使其朝向期望的目标预测,从而实现目标条件化的反事实生成。
- 通过推理期间的掩码动作空间强制实施特征约束(如不可变特征或取值范围),并在生成过程中采样约束值。
- 该方法采用预训练自编码器来重建并评估分布内质量,并引入一致性损失以稳定训练过程。
- 整个训练流程完全模型无关,仅依赖黑箱模型预测作为奖励反馈,不使用梯度信息。
- 通过适配自编码器和观测空间,该框架可同时支持表格数据和图像数据,且仅需极少的架构修改。
实验结果
研究问题
- RQ1能否通过用可学习的、端到端的强化学习过程替代迭代优化,使反事实生成实现可扩展性和高效性?
- RQ2在不依赖模型梯度或架构假设的前提下,模型无关方法在多大程度上能生成有效、稀疏且分布内的反事实?
- RQ3在真实世界数据集中,当存在不可变性或取值范围等特征约束时,该方法的性能如何?
- RQ4该框架能否在仅需极少适配的情况下扩展至高维数据模态(如图像)?
- RQ5与现有最先进反事实生成方法相比,该方法在有效性、稀疏性和分布内质量方面的表现如何?
主要发现
- 该方法在单次前向传播中生成反事实实例,消除了对每实例迭代优化的需求,支持批量推理。
- 在表格数据集上,该方法在有效性与分布内性能方面与最先进的方法(如DiCE和MO)相当,且在重叠类别分布上的MMD得分更低。
- 通过从约束的条件向量中采样,该方法在保持高有效性的同时生成多样化的反事实,性能仅略有下降。
- 该框架成功为图像数据(MNIST和CelebA)生成了有效且分布内的反事实,证明了其在表格数据之外的泛化能力。
- 该方法在训练过程中表现出强鲁棒性与稳定性,仅需极少的超参数调优,并在多个数据集和模型类型上保持一致的性能表现。
- 在关键指标上,该方法优于或匹配了基线方法:实现了高有效性、低稀疏性以及有利的MMD得分,尤其在类别分布重叠的场景中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。