Skip to main content
QUICK REVIEW

[논문 리뷰] A unified logical framework for explanations in classifier systems

Xinghan Liu, Emiliano Lorini|arXiv (Cornell University)|2021. 05. 30.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 이元 분류기 결정을 설명하기 위한 통합된 모달 논리 프레임워크를 제안하며, 추론적, 대조적, 가상의 설명 및 편향을 형식화할 수 있도록 한다. 두 증명 체계에 대한 완전성과 무한 변수 경우의 만족 가능성에 대한 NEXPTIME-완전성, 유한 변수 경우의 다항 시간 복잡도를 입증하며, 모델 업데이트와 불확실성 표현을 위한 동적 및 지식론적 연산자를 확장한다.

ABSTRACT

Recent years have witnessed a renewed interest in Boolean function in explaining binary classifiers in the field of explainable AI (XAI). The standard approach of Boolean function is propositional logic. We present a modal language of a ceteris paribus nature which supports reasoning about binary input classifiers and their properties. We study a family of classifier models, axiomatize it as two proof systems regarding the cardinality of the language and show completeness of our axiomatics. Moreover, we prove that satisfiability checking problem for our modal language is NEXPTIME-complete in the infinite-variable case, while it becomes polynomial in the finite-variable case. We furthermore identify an interesting NP fragment of our language in the infinite-variable case. We leverage the language to formalize counterfactual conditional as well as a variety of notions of explanation including abductive, contrastive and counterfactual explanations, and biases. Finally, we present two extensions of our language: a dynamic extension by the notion of assignment enabling classifier change and an epistemic extension in which the classifier's uncertainty about the actual input can be represented.

연구 동기 및 목표

  • 이원 분류기 시스템의 결정을 설명하기 위한 공식적이고 논리적인 기반을 제공함으로써 설명 가능한 인공지능(XAI) 분야에서의 통합 프레임워크 부족 문제를 해결한다.
  • 단일 모달 논리 프레임워크 내에서 추론적, 대조적, 가상의, 편향 관련 설명 유형을 형식화한다.
  • 논리에 대한 증명 체계를 수립하고, 두 가지 다른 언어 기수(유한 및 무한 변수)에 대해 그 완전성을 입증한다.
  • 제안된 모달 언어에서 만족 가능성 검사의 계산 복잡도를 분석하며, 변수의 유한성 여부에 따라 차이를 구분한다.
  • 분류기 업데이트와 입력에 대한 불확실성 표현을 모델링하기 위해 동적 및 지식론적 연산자를 논리에 확장한다.

제안 방법

  • 분류기 모델(CM) 위에서 Kripke 스타일의 의미론을 기반으로 한 모달 언어를 제안하며, 세계는 입력 인스턴스를 나타내고, 접근 가능성 관계는 변형(특성 값 변경)을 표현한다.
  • 핵심 모달 연산자 정의: $[\text{Atm}]\theta$ 는 'Atm에 속한 모든 원자들을 변형한 후 θ가 참이다'를 의미하며, $\text{closest}_C(s, \theta, X)$ 는 특정 변형 집합 하에서 가장 가까운 세계를 포괄한다.
  • 설명 유형에 대한 공식 정의 도입: 추론적 설명($\mathsf{AXp}$)은 출력을 이끌어내는 최소 조건을 의미하고, 대조적 설명($\mathsf{CXp}$)은 가상 조건을 표현하며, 편향 탐지($\mathsf{Bias}$)는 변형에 대해 불변성 실패를 통해 이루어진다.
  • 유한 변수 및 무한 변수 조각을 위한 각각의 증명 체계를 개발하고, 의미론에 대해 그 완전성을 입증한다.
  • 분류기의 불확실성을 표현하기 위해 $\mathcal{L}^{\mathit{epi}}$ 라는 지식론적 확장을 도입하고, 분류기 업데이트를 모델링하기 위한 할당 연산자를 포함한 동적 확장을 제안한다.
  • 모델 체킹과 유계 모델 구성 기법을 사용하여, 유한 변수 경우의 만족 가능성은 다항 시간 내에 결정 가능하고, 무한 변수 경우는 NEXPTIME-완전하다는 것을 입증한다.

실험 결과

연구 질문

  • RQ1단일 모달 논리 프레임워크로 이원 분류기 시스템 내 다양한 설명 유형의 형식화를 통합할 수 있는가?
  • RQ2제안된 논리의 증명 이론적 및 모델 이론적 성질은 무엇이며, 증명 체계는 완전한가?
  • RQ3제안된 모달 언어에서 만족 가능성 검사의 계산 복잡도는 무엇이며, 변수의 유한성 여부에 따라 어떻게 달라지는가?
  • RQ4논리는 가상의 추론을 표현하고 분류기 결정의 편향을 탐지할 수 있는가?
  • RQ5논리는 분류기 업데이트와 입력에 대한 불확실성을 모델링하기 위해 어떻게 확장될 수 있는가?

주요 결과

  • 제안된 모달 논리 프레임워크는 추론적, 대조적, 가상의, 편향 관련 설명을 단일 논리 체계 내에서 성공적으로 통합하였다.
  • 논리는 두 가지 증명 체계—유한 변수 및 무한 변수 경우—로 공리화되었으며, 둘 다 의미론에 대해 타당성과 완전성이 입증되었다.
  • 만족 가능성 검사는 무한 변수 경우에서 NEXPTIME-완전하고, 유한 변수 경우에서는 다항 시간 내에 결정 가능하다.
  • 무한 변수 경우 내에서 NP-완전인 부분 집합이 특정화되어, 다수의 공식에 대해 효율적인 추론이 가능하다.
  • 지식론적 확장은 분류기의 불확실성을 모델링할 수 있게 하며, 동적 확장은 할당 연산자를 통해 분류기 변화에 대한 추론을 지원한다.
  • 프레임워크는 핵심 설명 개념을 검증한다. 예를 들어, $\mathsf{CXp}(\lambda, c)$ 는 $\lambda$의 원자들을 변형하면 출력 $c$ 가 달라진다는 가상 조건과 논리적으로 동치이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.