Skip to main content
QUICK REVIEW

[논문 리뷰] Explainable Image Classification with Evidence Counterfactual

Tom Vermeire, David Martens|arXiv (Cornell University)|2020. 04. 16.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 이미지 분류를 위한 모델에 종속되지 않는 인스턴스 수준의 설명 방법인 SEDC와 SEDC-T를 제안한다. 이 방법은 모델의 예측을 변경시키는 최소한의 이미지 세그먼트 조합을 식별함으로써 시각적 대체가치 설명을 생성한다. LIME, SHAP, LRP와 같은 기존 기능 중요도 방법의 한계를 보완하여, 크기 최적화된, 기능에 따라 달라지는 다중 클래스 기반 설명을 제공하며, 15초 이내에 잘못 분류된 이미지에서 목표 대체가치 클래스를 86%의 성공률로 발견한다.

ABSTRACT

The complexity of state-of-the-art modeling techniques for image classification impedes the ability to explain model predictions in an interpretable way. Existing explanation methods generally create importance rankings in terms of pixels or pixel groups. However, the resulting explanations lack an optimal size, do not consider feature dependence and are only related to one class. Counterfactual explanation methods are considered promising to explain complex model decisions, since they are associated with a high degree of human interpretability. In this paper, SEDC is introduced as a model-agnostic instance-level explanation method for image classification to obtain visual counterfactual explanations. For a given image, SEDC searches a small set of segments that, in case of removal, alters the classification. As image classification tasks are typically multiclass problems, SEDC-T is proposed as an alternative method that allows specifying a target counterfactual class. We compare SEDC(-T) with popular feature importance methods such as LRP, LIME and SHAP, and we describe how the mentioned importance ranking issues are addressed. Moreover, concrete examples and experiments illustrate the potential of our approach (1) to obtain trust and insight, and (2) to obtain input for model improvement by explaining misclassifications.

연구 동기 및 목표

  • 기존 기능 중요도 기반 설명 방법의 한계를 해결하기 위해, 예측 크기 최적화 부족, 기능 의존성 고려 부족, 단일 클래스에 국한된 분석 등의 문제를 해결하고자 한다.
  • 복잡한 이미지 분류 모델에 대해 인간이 이해할 수 있는, 시각적 대체가치 설명을 생성하는 모델에 종속되지 않는 인스턴스 수준의 설명 방법을 개발하고자 한다.
  • 오분류가 발생한 이유와 잘못된 예측을 이끌어낸 증거를 드러내어 신뢰 구축, 통찰 제공 및 모델 개선을 지원하고자 한다.
  • GDPR의 '설명 권리'와 같은 규제 요구사항을 충족시키기 위해 대조적이고 실행 가능한 설명을 제공하고자 한다.
  • 실제 오분류 상황에서 대체가치 설명의 효과성을 실증 실험을 통해 평가하고자 한다.

제안 방법

  • SEDC는 모델의 예측 클래스를 변경시키는 데 필요한 최소한의 이미지 세그먼트 조합을 식별하여 시각적 대체가치 설명을 형성한다.
  • SEDC-T는 사용자가 목표 클래스를 지정할 수 있도록 하여 잘못 분류된 인스턴스에 대해 타겟된 대체가치 생성을 가능하게 하여 SEDC를 확장한다.
  • 이 방법은 분할된 이미지 영역을 대상으로 탐색 알고리즘을 사용하여, 예측이 변경되는 조합의 세그먼트 제거를 반복적으로 테스트한다.
  • 세그먼트 분할은 사전 구축된 방법(예: SLIC)을 사용하며, 탐색 중 세그먼트 교체를 통해 제거 효과를 시뮬레이션한다.
  • 이 방법은 모델 아키텍처나 기울기 접근이 필요 없어, 어떤 블랙박스 이미지 분류기와도 호환되며 모델에 종속되지 않는다.
  • 설명의 평가 기준은 제거된 세그먼트 수의 최소화와 예측 신뢰도의 변화에 기반한다.

실험 결과

연구 질문

  • RQ1SEDC와 SEDC-T가 생성하는 시각적 대체가치 설명은 기존 기능 중요도 방법에 비해 복잡한 이미지 분류 모델의 해석 가능성을 향상시키는가?
  • RQ2SEDC-T는 합리적인 시간 내에 목표 클래스로 모델의 예측을 변경시키는 대체가치 설명을 얼마나 잘 생성하는가?
  • RQ3SEDC와 SEDC-T는 기존 설명 방법의 한계, 즉 예측 크기 최적화 부족과 다중 클래스 고려 부족 문제를 어떻게 해결하는가?
  • RQ4오분류가 발생한 경우, SEDC-T는 잘못된 예측을 이끌어낸 분류적 증거를 식별하고 모델 개선을 이끌 수 있는가?
  • RQ5SEDC-T가 시간 제한 내에 목표 클래스에 도달하지 못하는 실패 요인은 무엇이며, 이는 이미지 콘텐츠와 레이블링과 어떻게 관련이 있는가?

주요 결과

  • SEDC-T는 15초 이내의 탐색 시간 동안 2,121개의 잘못 분류된 이미지 중 1,831개(86%)에서 정확한 목표 클래스를 성공적으로 발견했다.
  • 목표에 도달하지 못한 290개 중 289개의 경우, 탐색 과정에서 목표 클래스와 예측 클래스 점수 간 거리가 향상되는 변형을 생성하여 목표 향한 진전을 보였다.
  • 실패 사례는 주로 모호한 레이블링으로 인한 것이었으며, 데스크톱 컴퓨터나 책상가운데에 있는 쥐와 같은 맥락적으로 타당한 정답 클래스가 존재하는 경우, 잘못된 클래스에 대한 증거를 분리하기 어려웠다.
  • 어떤 경우는 실제 객체(예: 권총의 회전식 탄창)가 포함된 세그먼트를 제외한 나머지 모든 세그먼트를 제거한 후에도 모델이 정확한 클래스를 예측하지 못하는 것으로 나타나, 더 깊은 모델 편향이나 아키텍처적 제약이 존재함을 시사했다.
  • 이 방법은 오분류 사례에서 분류적 증거를 성공적으로 식별하였으며, 예를 들어 권총의 회전식 탄창 존재 여부 등은 데이터 증강 및 모델 재학습에 유용한 정보를 제공할 수 있다.
  • 실제 의사결정 환경에서 SEDC-T의 해석 가능성과 설명 가능성 검증을 위해 사용자 연구를 권장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.