[논문 리뷰] From Attribution Maps to Human-Understandable Explanations through Concept Relevance Propagation
이 논문은 개념 아틀라스와 개념 조건부 설명을 통해 속성 맵을 인간이 이해할 수 있는 개념과 연결함으로써 딥러닝에서 局소 및 전역적 해석 가능성의 통합을 시도하는 Concept Relevance Propagation (CRP)을 소개한다. CRP는 예측을 이끄는 개념(예: 눈 모양, 주름 등)과 그 조합 방식을 식별함으로써 표준 속성 맵보다 훨씬 높은 수준의 설명 가능성과 정밀도를 제공함으로써 모델 결정의 정확하고 해석 가능한 설명을 가능하게 한다.
The field of eXplainable Artificial Intelligence (XAI) aims to bring transparency to today's powerful but opaque deep learning models. While local XAI methods explain individual predictions in form of attribution maps, thereby identifying where important features occur (but not providing information about what they represent), global explanation techniques visualize what concepts a model has generally learned to encode. Both types of methods thus only provide partial insights and leave the burden of interpreting the model's reasoning to the user. In this work we introduce the Concept Relevance Propagation (CRP) approach, which combines the local and global perspectives and thus allows answering both the "where" and "what" questions for individual predictions. We demonstrate the capability of our method in various settings, showcasing that CRP leads to more human interpretable explanations and provides deep insights into the model's representation and reasoning through concept atlases, concept composition analyses, and quantitative investigations of concept subspaces and their role in fine-grained decision making.
연구 동기 및 목표
- 지역적 XAI 방법의 한계를 해결하기 위해 중요 기능이 '어디에' 있는지만 특정할 뿐 '무엇인지'를 밝히지 못하는 문제를 해결하기 위해.
- 전역적 XAI 방법의 격차를 극복하기 위해 일반적인 모델 개념은 드러내지만, 그 개념이 각 샘플에 어떻게 사용되는지는 밝히지 못하는 문제를 해결하기 위해.
- 모델의 속성 맵을 이해할 수 있고 의미가 있는 개념과 연결함으로써 지역적 및 전역적 XAI를 통합하기 위해.
- 개념 아틀라스와 개념 조합 분석을 통해 모델 결정의 정밀하고 인간이 이해할 수 있는 설명을 가능하게 하기 위해.
- 의료 등 고위험 응용 분야에서의 해석 가능성 향상을 위해 모델의 추론 과정에 대해 더 명확하고 신뢰할 수 있는 통찰을 제공하기 위해.
제안 방법
- CRP는 LRP와 같은 지역적 속성 방법을 확장하여 특정 개념에 조건을 두고 네트워크 전반에 걸쳐 관련성을 전파한다.
- 특정으로 학습된 개념에 해당하는 입력 특징의 부분을 고립하고 강조하기 위해 개념 조건부 관련성 계산을 사용한다.
- 모델의 신뢰도에 영향을 받지 않도록 각 레이어의 관련성 정규화를 적용함으로써 다양한 데이터 분포 간의 공정한 비교가 가능해진다.
- 특정 개념에 대해 각 레이어에서 관련성을 최대화하는 입력을 식별하는 RelMax 방법을 사용해 기준 이미지(개념 대표자)를 선정한다.
- 배치 정규화 레이어 통합 등의 조치를 통해 모델를 재구성함으로써 속성 전파의 안정성과 일관성을 향상시키는 캐논라이제이션을 적용한다.
- PyTorch용 zennit 라이브러리와 통합되어 엔드 투 엔드 CRP 및 RelMax 계산이 가능하며, 오픈소스 지원을 제공한다.
실험 결과
연구 질문
- RQ1예측을 이끄는 특정 개념을 식별함으로써 지역적 속성 맵을 인간이 이해할 수 있는 설명으로 전환할 수 있는가?
- RQ2분포 외 데이터를 사용할 경우, 각 레이어의 관련성 정규화는 개념 표현 선택에 얼마나 기여하는가?
- RQ3개념 아틀라스와 개념 조합 분석은 딥 네트워크의 세밀한 의사결정 과정을 드러내는 데 효과적인가?
- RQ4다양한 입력 샘플에 걸쳐 해석 가능성과 일관성 면에서 표준 속성 방법에 비해 CRP는 어떠한가?
- RQ5개념 조건부 설명은 복잡한 이미지 분류 작업에서 모호하거나 겹치는 속성 맵을 명확히 하는 데 효과적인가?
주요 결과
- 각 레이어의 관련성 정규화를 통해 모델 신뢰도가 낮을 때조차 분포 외 데이터셋(예: ImageNet)에서 개념 대표 이미지를 선정할 수 있어 개념의 다양성이 증가한다.
- 각 레이어 정규화를 통해 학습 데이터셋 외의 데이터셋(예: Caltech-UCSD Birds 200)에서 유래한 기준 샘플이 더 자주 선정되며, 이는 모델 신뢰도와 무관한 개념 표현을 드러낸다.
- CRP를 통해 기준 이미지에 개념 조건부 마스크를 적용함으로써 입력 이미지 내 특정 부분(예: 망막, 공막, 주름 등)을 시각화할 수 있다.
- CRP를 통해 생성된 개념 아틀라스는 눈 모양, 얼굴 주름 등의 다양한 개념이 조합되어 세밀한 예측(예: 연령대 분류)을 내는 방식을 드러낸다.
- 이 방법은 속성 맵을 특정 의미적 개념에 연결된 의미 있는 해석 가능한 구성요소로 분해할 수 있음을 보여주며, 모델 해석의 모호성을 감소시킨다.
- CRP는 개념 부분공간과 그 의사결정 과정에서의 역할에 대한 정량적 통찰을 제공하여 특정 예측에 기여하는 개념의 기여도를 분석할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.