[논문 리뷰] Issues with post-hoc counterfactual explanations: a discussion
이 논문은 후행적 대체적 설명에서의 세 가지 핵심 결함인 근접성, 연결성, 안정성에 주목한다. 훈련 데이터에 접근할 수 없을 경우, 후행적 방법은 종종 국소적으로 충실하지 못하거나 실제 데이터에서 분리되며, 작은 입력 변형에 대해 불안정한 설명을 생성함으로써 실생활 응용에서의 해석 가능성과 신뢰성에 악영향을 미친다고 주장한다.
Counterfactual post-hoc interpretability approaches have been proven to be useful tools to generate explanations for the predictions of a trained blackbox classifier. However, the assumptions they make about the data and the classifier make them unreliable in many contexts. In this paper, we discuss three desirable properties and approaches to quantify them: proximity, connectedness and stability. In addition, we illustrate that there is a risk for post-hoc counterfactual approaches to not satisfy these properties.
연구 동기 및 목표
- 높은 품질의 대체적 설명을 정의하는 데 있어 필수적인 세 가지 기준인 근접성, 연결성, 안정성을 식별하고 분석하는 것.
- 훈련 데이터에 접근할 수 없는 후행적 대체적 방법이 이 기준들을 충족하지 못함을 보여주는 것.
- 후행적 접근 방식에서 진정한 데이터와 모델 구조가 없기 때문에 발생하는 신뢰할 수 없거나 오해의 소지가 있거나 실행 가능하지 않은 설명을 주장하는 것.
- 현재 후행적 접근 방식을 재평가할 필요성을 제기하고, 설명 품질 향상을 위해 훈련 데이터를 통합할 것을 주장하는 것.
제안 방법
- 입력 x에 대해 근접하고(f(x) ≠ f(E(x))) 모델이나 데이터에 접근하지 않고 생성된 설명 E(x)를 공식화하는 것.
- 연결성 C(E(x))를 정의하는 지표를 제안하며, 이는 E(x)의 ε-이웃 중 E(x)와 같은 클래스에 속하는 비율로 정의되며, C(E(x)) = 0은 실제 데이터와의 연결성이 없음을 의미한다.
- Alvarez Melis & Jaakkola (2018)에서 유도된 안정성 지표 \bar{L}_X(x)를 적응하여, 국소 영역 내에서 입력 변화에 대한 설명 변화 비율을 측정하는 것.
- 합성 및 실제 데이터셋(Iris 등)을 대상으로 실증 평가를 수행하여 HCLS 및 GS와 같은 후행적 방법에서의 근접성, 연결성, 안정성 위반 정도를 수량화하는 것.
- 시각화와 정량적 분석을 통해 합성 문제에서 최대 17.8%의 대체적 설명이 실제 데이터에서 분리되어 있음을 보여주는 것.
- 훈련 데이터를 활용하여 대체적 설명의 품질을 향상시켜야 한다고 제안하나, 이는 후행적 가정인 블랙박스 접근 전용과는 정면으로 배치된다.
실험 결과
연구 질문
- RQ1후행적 대체적 설명은 원래 인스턴스와 결정 경계에서 얼마나 근접성을 유지하지 못하는가?
- RQ2후행적 대체적 설명이 실제 훈련 데이터와 연결되지 않는 빈도는 얼마나 되며, 이를 측정할 수 있는 지표는 무엇인가?
- RQ3왜 안정성은 대체적 설명에 대해 문제적인 기준이 되는가? 이는 모델의 강건성과 어떻게 다를까?
- RQ4훈련 데이터에 접근할 수 없음에도 불구하고 후행적 대체적 방법은 충실하고 실행 가능한 설명을 생성할 수 있는가?
- RQ5실생활 인공지능 시스템에서 분리되거나 불안정한 대체적 설명이 사용자 신뢰와 의사결정에 미치는 영향은 무엇인가?
주요 결과
- 두 개의 고립된 결정 영역을 가진 합성 문제에서 HCLS 및 GS에 의해 생성된 대체적 설명 중 17.8%가 C(E(x)) = 0로 측정되어 실제 훈련 인스턴스와 연결되지 않았다.
- 후행적 대체적 방법은 특성 공간의 데이터가 희박하거나 존재하지 않는 영역에 위치한 설명을 생성할 수 있어, 실생활에서의 실행 가능성을 떨어뜨린다.
- 안정성 지표인 \bar{L}_X(x)는 분류기의 결정 경계에서 자연스러운 변동을 반영할 수 있으며, 이는 설명 품질의 약한 지표로 기능할 수 있다.
- 매우 안정적이지만 잘못된 설명(예: 모든 입력에 대해 동일한 잘못된 설명)은 높은 안정성 점수를 얻을 수 있어, 안정성만으로는 신뢰할 수 있는 설명을 확보할 수 없음을 시사한다.
- 후행적 환경에서 훈련 데이터에 접근할 수 없는 것은 대체적 설명이 실제 데이터 분포에 기반할 수 있도록 보장할 능력을 본질적으로 제한한다.
- 논문은 후행적 가정과는 정면으로 배치되지만, 훈련 데이터를 설명 과정에 통합하는 것이 신뢰할 수 있고 충실하며 유용한 대체적 설명을 달성하기 위해 필수적이라고 결론 내린다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.