[논문 리뷰] When a Relation Tells More Than a Concept: Exploring and Evaluating Classifier Decisions with CoReX
이 논문은 컨volution 신경망(CNN)을 위한 새로운 설명 가능 AI 방법인 CoReX를 제안한다. CoReX는 픽셀 수준의 관련성을 넘어서 개념과 관계 기반 추론을 사용해 모델 결정을 설명함으로써 해석 가능성을 향상시킨다. 유도적 논리 프로그래밍에서 유도된 논리 규칙과 개념 관련성을 결합함으로써, 공간적 관계(예: '노두 오른쪽에 손잡이')가 분류에 기여하는 방식을 드러내는 신뢰할 수 있고 대조적인 설명을 생성한다. 이는 복잡한 도메인(예: 생의학)에서 오분류 탐지 및 모델 평가를 가능하게 한다.
Explanations for Convolutional Neural Networks (CNNs) based on relevance of input pixels might be too unspecific to evaluate which and how input features impact model decisions. Especially in complex real-world domains like biology, the presence of specific concepts and of relations between concepts might be discriminating between classes. Pixel relevance is not expressive enough to convey this type of information. In consequence, model evaluation is limited and relevant aspects present in the data and influencing the model decisions might be overlooked. This work presents a novel method to explain and evaluate CNN models, which uses a concept- and relation-based explainer (CoReX). It explains the predictive behavior of a model on a set of images by masking (ir-)relevant concepts from the decision-making process and by constraining relations in a learned interpretable surrogate model. We test our approach with several image data sets and CNN architectures. Results show that CoReX explanations are faithful to the CNN model in terms of predictive outcomes. We further demonstrate through a human evaluation that CoReX is a suitable tool for generating combined explanations that help assessing the classification quality of CNNs. We further show that CoReX supports the identification and re-classification of incorrect or ambiguous classifications.
연구 동기 및 목표
- 복잡한 이미지 분류 작업에서 고수준의 관계적 특징을 포착하지 못하는 픽셀 수준의 설명의 한계를 해결하기 위해.
- 특히 모호하거나 경계에 가까운 경우에서 예측에 영향을 주는 개념과 관계를 식별함으로써 모델 평가를 향상시키기 위해.
- 사용자가 어떤 개념이나 관계를 억제하거나 강조해야 하는지 지정할 수 있도록 해, 상호작용 기반 모델 수정을 지원하기 위해.
- 개념 활성화 관련성과 논리 기반 추론을 결합하여 더 해석 가능하고 신뢰할 수 있는 설명을 제공하는 방법을 개발하기 위해.
- 관계 지식을 활용한 대조적 설명(유사하지만 다른 클래스로 분류된 이미지 간 비교)의 실용성을 입증하기 위해.
제안 방법
- CoReX는 개념 관련성 전파를 사용해 중간 CNN 특징 내에서 개념을 식별하고 국소화하며, 분류에 기여하는 정도에 따라 양성, 음성 또는 중립 점수를 할당한다.
- 높은 관련성 픽셀 그룹을 군집화하여 의미 있는 개념을 추출하고, 자연어 표현(예: '손잡이', '노두')으로 레이블링한다.
- 유도적 논리 프로그래밍(ILP)을 사용해 공간적 및 구조적 관계(예: '노두가 손잡이 오른쪽')를 기반으로 해석 가능한 논리 규칙을 학습한다.
- 학습된 ILP 이론을 바탕으로 서브stituted 모델을 구축하며, 관련 없는 개념을 마스킹하고 관계 제약 조건을 강제함으로써 예측을 제약한다.
- 샘플을 대조 클래스의 반사적 예시와 비교하여 구분되는 관계를 강조함으로써 설명을 생성한다.
- 상호작용 기반 피드백을 지원한다: 사용자는 오분류를 수정하기 위해 규칙를 수정할 수 있으며, 인간이 참여하는 방식으로 모델 정규화를 가능하게 한다.

실험 결과
연구 질문
- RQ1픽셀 수준의 설명이 간과하는 고수준의 관계적 특징을 개념 및 관계 기반 설명이 어떻게 드러내는가, 특히 복잡한 이미지 분류 작업에서?
- RQ2CoReX 설명은 훈련된 CNN의 실제 의사결정 과정을 얼마나 정확하게 반영하는가?
- RQ3CoReX는 잘못된 또는 모호한 개념 관계를 강조함으로써 오분류를 식별하고 설명할 수 있는가?
- RQ4사용자는 CoReX를 얼마나 효과적으로 활용해 규칙 수정을 통해 모델 행동을 수정할 수 있는가?
- RQ5관계 지식의 통합이 실생활 도메인(생의학 또는 세밀한 시각 분류)에서 CNN 결정의 해석 가능성과 평가 가능성에 어떤 영향을 미치는가?
주요 결과
- CoReX 설명은 다양한 데이터셋과 아키텍처에서 예측 일관성 검증을 통해 기반 CNN 모델과 매우 높은 유사성을 보이며, 신뢰할 수 있는 설명을 제공한다.
- 픽셀 수준의 방법이 표현하지 못하는, '노두가 손잡이 오른쪽에 있다'와 같은 구분 가능한 관계를 성공적으로 식별하여 '티포트'와 '꽃병'을 구분하는 데 기여한다.
- Adience 데이터셋에서 CoReX는 '눈이 미소 짓는 입 위에 있다'는 관계로 정의된 대표적 군집을 발견하여 미세한 얼굴 구조 패턴을 포착할 수 있음을 보여준다.
- Picasso 데이터셋에서 CoReX는 배경 잡음 요소로 인해 잘못 분류된 남성 얼굴가 지식 기반 규칙에 포함되지 않음을 밝혀내어 모델이 유사한 특징에 민감하게 반응함을 드러냈다.
- 규칙 수정을 통해 오분류를 상호작용적으로 수정할 수 있었으며, 인간이 참여하는 모델 정밀 조정 잠재력을 보여주었다.
- Adience 평가에서 빈 군집이 발견되어 어떤 규칙에도 포함되지 않은 잘못 분류된 남성 샘플이 드러났으며, 이는 문제 있는 케이스를 인간 검토를 위해 식별할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.