[论文解读] A unified logical framework for explanations in classifier systems
本文提出了一种统一的模态逻辑框架,用于解释二元分类器的决策,支持对溯因式、对比式和反事实解释以及偏见的形式化。该框架为两个证明系统建立了完备性,证明了在无限变量情况下满足性的 NEXPTIME 完全性,以及在有限变量情况下为多项式时间,并通过引入动态和认识论算子扩展了逻辑,以建模模型更新和不确定性表示。
Recent years have witnessed a renewed interest in Boolean function in explaining binary classifiers in the field of explainable AI (XAI). The standard approach of Boolean function is propositional logic. We present a modal language of a ceteris paribus nature which supports reasoning about binary input classifiers and their properties. We study a family of classifier models, axiomatize it as two proof systems regarding the cardinality of the language and show completeness of our axiomatics. Moreover, we prove that satisfiability checking problem for our modal language is NEXPTIME-complete in the infinite-variable case, while it becomes polynomial in the finite-variable case. We furthermore identify an interesting NP fragment of our language in the infinite-variable case. We leverage the language to formalize counterfactual conditional as well as a variety of notions of explanation including abductive, contrastive and counterfactual explanations, and biases. Finally, we present two extensions of our language: a dynamic extension by the notion of assignment enabling classifier change and an epistemic extension in which the classifier's uncertainty about the actual input can be represented.
研究动机与目标
- 为二元分类器系统所作决策提供一个正式的、逻辑的基础,以解决可解释人工智能(XAI)中缺乏统一框架的问题。
- 在一个单一的模态逻辑框架内,正式化多种解释类型——溯因式、对比式、反事实以及与偏见相关的解释。
- 为该逻辑建立证明系统,并就两种不同语言基数(有限变量与无限变量)证明其完备性。
- 分析所提出的模态语言中满足性检查的计算复杂性,区分有限变量与无限变量情况。
- 通过引入动态和认识论算子扩展逻辑,以建模分类器更新和对输入的不确定性。
提出的方法
- 提出一种基于分类器模型(CMs)上 Kripke 风格语义的模态语言,其中世界代表输入实例,可达关系编码扰动(特征值变化)。
- 定义关键模态算子:$[\text{Atm}]\theta$ 表示‘在对 Atm 中的所有原子进行扰动后,θ 成立’,以及 $\text{closest}_C(s, \theta, X)$ 以捕捉在扰动集合下的最近世界。
- 引入解释类型的正式定义:溯因解释($\mathsf{AXp}$)为一个最小项,其蕴含输出;对比解释($\mathsf{CXp}$)为一个反事实条件;偏见检测($\mathsf{Bias}$)通过扰动下不变性失效来实现。
- 设计两个证明系统——一个用于有限变量,一个用于无限变量片段——并证明其相对于语义的完备性。
- 引入一个认识论扩展 $\mathcal{L}^{\mathit{epi}}$ 以表示分类器的不确定性,以及一个带有赋值算子的动态扩展,以建模分类器更新。
- 使用模型检测和有界模型构造,表明在有限变量情况下满足性为多项式时间,在无限变量情况下为 NEXPTIME 完全。
实验结果
研究问题
- RQ1一个单一的模态逻辑框架能否统一形式化二元分类器系统中多种解释类型的表达?
- RQ2所提出的逻辑的证明论与模型论性质是什么?其证明系统是否完备?
- RQ3所提出模态语言中满足性检查的计算复杂性如何?其在变量有限性上的差异如何?
- RQ4该逻辑能否表达反事实推理并检测分类器决策中的偏见?
- RQ5如何扩展该逻辑以建模分类器更新和对输入的不确定性?
主要发现
- 所提出的模态逻辑框架成功地在一个单一的逻辑系统中统一了对溯因式、对比式、反事实以及与偏见相关的解释的形式化。
- 该逻辑通过两个证明系统进行公理化——一个用于有限变量,一个用于无限变量情况——两者均被证明是可靠且完备的。
- 在无限变量情况下,满足性检查为 NEXPTIME 完全;在有限变量情况下,满足性检查为多项式时间可判定。
- 在无限变量情况下识别出一个 NP 完全的片段,使得对一个显著子集公式的高效推理成为可能。
- 认识论扩展允许对分类器不确定性进行建模,而动态扩展则通过赋值算子支持对分类器变化的推理。
- 该框架验证了关键解释概念:例如,$\mathsf{CXp}(\lambda, c)$ 在逻辑上等价于一个反事实条件,即扰动 $\lambda$ 的原子会导致输出 $c$ 发生改变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。