[논문 리뷰] Best of both worlds: local and global explanations with human-understandable concepts
이 논문은 국소적, 기능 수준의 설명을 위한 통합 기울기(IG)와 전역적, 개념 기반의 설명을 위한 개념 활성화 벡터를 사용한 테스팅(TCAV)을 통합하는 통합 개념 민감도(ICS)를 제안한다. IG에서 유도된 개념별 샐런시 스코어를 데이터 전반에 걸쳐 집계함으로써 ICS는 일관되고 인간이 이해할 수 있는 국소적 및 전역적 설명을 가능하게 하며, 이는 순수 TCAV에 비해 신뢰도를 향상시킨다는 것이 입증되었다. 사용자 연구를 통해 검증되었다.
Interpretability techniques aim to provide the rationale behind a model's decision, typically by explaining either an individual prediction (local explanation, e.g. 'why is this patient diagnosed with this condition') or a class of predictions (global explanation, e.g. 'why is this set of patients diagnosed with this condition in general'). While there are many methods focused on either one, few frameworks can provide both local and global explanations in a consistent manner. In this work, we combine two powerful existing techniques, one local (Integrated Gradients, IG) and one global (Testing with Concept Activation Vectors), to provide local and global concept-based explanations. We first sanity check our idea using two synthetic datasets with a known ground truth, and further demonstrate with a benchmark natural image dataset. We test our method with various concepts, target classes, model architectures and IG parameters (e.g. baselines). We show that our method improves global explanations over vanilla TCAV when compared to ground truth, and provides useful local insights. Finally, a user study demonstrates the usefulness of the method compared to no or global explanations only. We hope our work provides a step towards building bridges between many existing local and global methods to get the best of both worlds.
연구 동기 및 목표
- 기계 학습에서 국소적 해석 방법과 전역적 해석 방법 간 격차를 메우기 위해.
- 국소적으로 충실하고 전역적으로 대표적인 일관된 개념 기반 설명을 제공하기 위해.
- 통합 기울기에서 유도한 국소적 할당을 활용하여 순수 TCAV에 비해 전역 설명의 신뢰도를 향상시키기 위해.
- 다양한 개념과 모델 아키텍처를 가진 합성 및 실제 데이터셋에서 방법을 검증하기 위해.
- 사용자 연구를 통해 국소적 및 전역적 설명의 조합이 실용적으로 얼마나 유용한지 평가하기 위해.
제안 방법
- ICS는 기준 입력에서 관심 있는 입력으로의 경로를 따라 통합 기울기(IG)를 통합함으로써 개념별 샐런시 스코어를 계산하며, 이는 개념별 기울기를 사용한다.
- 이 방법은 개념의 의미적 구조(예: '줄무늬' 또는 '잔디 배경')에 맞게 개념별 기준 입력을 정의한다.
- 간단한 선형 케이스에서 ICS에 대한 폐쇄형 해를 도출함으로써 분석적 검증이 가능해진다.
- 전역 설명은 데이터셋 전반의 ICS 스코어를 평균하여 각 클래스별 개념별 중요도 분포를 생성한다.
- 국소 설명은 각 이미지의 ICS 스코어로 시각화되며, 각 개념이 특정 예측에 어떻게 기여하는지 보여준다.
- 이 프레임워크는 다수의 개념, 모델 아키텍처, 기준 설정을 지원하여 체계적인 평가가 가능하다.
실험 결과
연구 질문
- RQ1통합된 방법이 인간이 이해할 수 있는 개념을 사용하여 국소적 및 전역적 설명을 제공할 수 있는가?
- RQ2기본 진실이 알려진 경우, ICS에서 유도된 전역 설명의 신뢰도는 순수 TCAV에 비해 어떻게 비교되는가?
- RQ3국소적 ICS 설명이 사용자가 개별 예측을 더 정확히 이해하는 데 얼마나 기여하는가?
- RQ4줄무늬, 색상, 형태와 같은 다양한 개념 정의 방식이 설명의 일관성과 해석 가능성에 어떤 영향을 미치는가?
- RQ5국소적 및 전역적 설명을 동시에 제공할 경우, 이를 별도로 제공하는 것보다 사용자의 이해도가 향상되는가?
주요 결과
- 합성 데이터셋에서 기본 진실과 비교해 볼 때, ICS는 순수 TCAV에 비해 전역 설명의 신뢰도를 향상시켰다.
- 이 방법은 일관되고 해석 가능한 국소적 설명을 생성하였으며, ICS 스코어는 관련 개념(예: 기린에 대한 '줄무늬')과 관련 없는 개념을 명확히 구분하였다.
- 사용자 연구에서 국소적 및 전역 설명을 함께 사용한 참가자들은 단일 전역 설명 또는 설명 없이 사용한 참가자들보다 더 정확한 예측을 내리고 더 높은 자신감을 보였다.
- 모델이 기린 분류에 '줄무늬'와 '잔디 배경' 같은 개념에 의존하는 것이 ICS를 통해 전역적 및 국소적으로 정확하게 포착되고 시각화되었다.
- '색상'과 '네 개의 다리'와 같은 개념들은 전반적으로 낮은 중요도를 보였으며, 도메인 지식과 일치하여 이 방법이 의미적 관련성에 민감하게 반응한다는 점을 검증하였다.
- 선형 케이스에서의 폐쇄형 해는 이론적 일관성을 확인하였으며, 더 넓은 적용 가능성을 위한 기반을 마련하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.