Skip to main content
QUICK REVIEW

[论文解读] Synthetic Benchmarks for Scientific Research in Explainable Machine Learning

Yang Liu, Sujay Khandagale|arXiv (Cornell University)|Jun 23, 2021
Explainable Artificial Intelligence (XAI)参考文献 73被引用 14
一句话总结

本文提出 XAI-Bench,一个可配置数据集的合成基准套件,以及用于评估可解释人工智能中特征归因方法的库。通过利用已知的数据分布精确计算真实值 Shapley 值及其他指标,该工具可在特征相关性与模型类型等多样化设置下,高效、可复现地评估 SHAP、LIME 和 L2X 等可解释性技术,显著加速开发过程并提前检测潜在故障,从而减少对人工评估的依赖。

ABSTRACT

As machine learning models grow more complex and their applications become more high-stakes, tools for explaining model predictions have become increasingly important. This has spurred a flurry of research in model explainability and has given rise to feature attribution methods such as LIME and SHAP. Despite their widespread use, evaluating and comparing different feature attribution methods remains challenging: evaluations ideally require human studies, and empirical evaluation metrics are often data-intensive or computationally prohibitive on real-world datasets. In this work, we address this issue by releasing XAI-Bench: a suite of synthetic datasets along with a library for benchmarking feature attribution algorithms. Unlike real-world datasets, synthetic datasets allow the efficient computation of conditional expected values that are needed to evaluate ground-truth Shapley values and other metrics. The synthetic datasets we release offer a wide variety of parameters that can be configured to simulate real-world data. We demonstrate the power of our library by benchmarking popular explainability techniques across several evaluation metrics and across a variety of settings. The versatility and efficiency of our library will help researchers bring their explainability methods from development to deployment. Our code is available at https://github.com/abacusai/xai-bench.

研究动机与目标

  • 为解决可解释人工智能中特征归因方法的评估与比较问题,此类方法常缺乏可靠、高效且客观的度量标准。
  • 克服真实世界数据集的局限性,因为在这些数据集中真实解释通常未知,且 Shapley 值等指标在计算上往往不可行。
  • 提供一个可扩展、可复现且可配置的环境,用于在人工评估前对可解释性算法进行基准测试。
  • 使研究人员能够在真实世界应用部署前检测到细微的故障模式(例如在高特征相关性下性能下降)。
  • 通过提供快速、自动化的评估流水线,加速可解释性方法从开发到部署的转化过程。

提出的方法

  • 作者生成具有已知真实数据分布的合成数据集,从而可精确计算 Shapley 值等指标所需的条件期望。
  • 该库支持可配置的数据集参数,包括特征相关性(ρ)、数据分布类型(如高斯分布、伯努利分布等)、特征尺度以及目标生成函数。
  • 支持关键评估指标的精确计算:与真实值 Shapley 值的距离、ROAR(移除并重训练)、忠实度、单调性及非忠实度。
  • 该框架支持通过协方差匹配与分布匹配,将真实世界数据集转换为合成对应物,以在保留真实解释性的同时模拟真实数据特征。
  • 该库与主流解释器(如 SHAP、LIME、L2X)集成,支持在多个维度上进行基准测试:模型类型、特征相关性与数据分布。
  • 提供 API 接口、文档以及实验结果,以支持可复现性与社区协作。

实验结果

研究问题

  • RQ1在具有已知真实值 Shapley 值的多种合成数据分布下,不同特征归因方法的表现如何?
  • RQ2特征相关性在多大程度上会降低可解释性方法的性能?是否可通过合成基准系统性地检测此类问题?
  • RQ3合成数据集能否有效模拟真实世界数据特征,同时支持评估指标的精确计算?
  • RQ4哪些评估指标(如忠实度、单调性)对可解释性算法中的故障模式最敏感?
  • RQ5如何利用合成基准指导新可解释性方法在人工评估前的开发与优化?

主要发现

  • XAI-Bench 库通过利用具有已知数据分布的合成数据集,实现了真实值 Shapley 值及其他指标的精确计算。
  • SHAP 与 LIME 在低至中等特征相关性(ρ ≤ 0.5)下表现一致,但在高相关性设置下观察到性能下降。
  • ROAR 指标显示,L2X 与 MAPLE 对特征移除更敏感,表明其解释保真度可能存在潜在不稳定性。
  • 忠实度与单调性指标检测到 SHAPR 与 L2X 在高特征相关性下存在系统性故障,其中 SHAPR 的非忠实度相比 SHAP 上升了 1.8 倍。
  • 该库成功识别出可解释性方法在高特征相关性下常出现失效,而这种故障模式在缺乏真实标签的真实数据集中极难被发现。
  • 作者证明,可通过协方差匹配与分布匹配,将真实数据有效映射为合成数据,从而实现在真实但可解释数据上的基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。