Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Grained Neural Network Explanation by Identifying Input Features with Predictive Information

Yang Zhang, Ashkan Khakzar|arXiv (Cornell University)|2021. 10. 04.
Explainable Artificial Intelligence (XAI)인용 수 12
한 줄 요약

이 논문은 예측 정보를 갖는 입력 특징을 식별하기 위해 출력과의 상호정보를 유지하는 입력 영역의 버블넥을 사용하는 새로운 방법인 InputIBA를 제안한다. 기존 방법들이 잠재 특징 근사에 의존하는 데 반해, InputIBA는 딥 특징을 가이드로 사용하여 입력 수준의 예측 정보를 직접 계산함으로써 아키텍처에 종속되지 않고 고해상도의 속성 부여를 달성하며, 국소화 및 특징 중요도 평가에서 기존 방법을 능가한다.

ABSTRACT

One principal approach for illuminating a black-box neural network is feature attribution, i.e. identifying the importance of input features for the network's prediction. The predictive information of features is recently proposed as a proxy for the measure of their importance. So far, the predictive information is only identified for latent features by placing an information bottleneck within the network. We propose a method to identify features with predictive information in the input domain. The method results in fine-grained identification of input features' information and is agnostic to network architecture. The core idea of our method is leveraging a bottleneck on the input that only lets input features associated with predictive latent features pass through. We compare our method with several feature attribution methods using mainstream feature attribution evaluation experiments. The code is publicly available.

연구 동기 및 목표

  • 기존 특징 속성 부여 방법이 신경망 예측에 기여하는 입력 특징을 정확히 식별하는 데에 한계를 지닌다는 문제를 해결하기 위해.
  • IBA와 같은 방법들이 잠재 특징으로부터의 보간 및 평균화에 의존함으로써 입력 속성 부여가 군집화되고 근사화된 성격을 띠는 문제를 해결하기 위해.
  • 아키텍처에 대한 가정 없이 입력 도메인에서 직접 예측 정보를 측정하고, 전체 해상도를 유지하는 방법을 개발하기 위해.
  • 이론적으로 탄탄한 세밀한 설명 방법을 제공하여 국소화 및 특징 중요도 평가에서 기존 베이스라인을 향상시키기 위해.

제안 방법

  • 이 방법은 예측 잠재 특징과 상관관계가 있는 특징만 선택적으로 통과하는 입력 버블넥을 도입하며, 입력과 잠재 표현 간의 대응 관계를 수립하기 위해 생성 모델을 사용한다.
  • 입력 버블넥은 입력 버블넥과 네트워크 출력 간의 상호정보를 최대화하는 변형 목표를 최적화하여 설정된다.
  • 버블넥은 딥 특징에 조건부인 가중치 마스크를 통해 학습되며, 이 마스크는 예측 정보를 유지하도록 훈련된다.
  • 이 방법은 IBA가 사용하는 정보 이론 원칙을 동일하게 활용하지만, 버블넥을 잠재 공간에서 입력 공간으로 이동시켜 입력 수준의 상호정보를 직접 계산할 수 있도록 한다.
  • 딥 생성 모델을 사용하여 잠재 특징의 분포를 동일하게 유도하는 입력 영역의 버블넥 변수를 추론한다.
  • 최종 속성 점수는 학습된 입력 마스크에서 유도되며, 이는 각 입력 특징의 예측 정보를 공간적 및 채널 수준의 전체 해상도로 표현한다.

실험 결과

연구 질문

  • RQ1잠재 특징 보간에 의존하지 않고 입력 도메인에서 직접 예측 정보를 식별할 수 있는가?
  • RQ2딥 특징에 의해 가이드되는 입력 수준의 버블넥이 잠재 수준의 버블넥에 비해 속성 정확도와 해상도 측면에서 어떻게 비교되는가?
  • RQ3InputIBA는 시각 및 NLP 작업 전반에서 관련 입력 특징을 국소화하는 데 있어 기존 속성 부여 방법보다 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ4아키텍처에 대한 가정 없이 다양한 네트워크 아키텍처에서 성능가 유지되는가?
  • RQ5ROAR, Sensitivity-N, Insertion-Deletion과 같은 표준 평가 벤치마크에서 이 방법의 성능은 어떠한가?

주요 결과

  • ImageNet 분류 작업에서 경계 상자 국소화를 수행한 결과, InputIBA는 0.476 ± 0.007의 최고 수준의 유효 열화 비율(EHR)을 기록했으며, IBA(0.356 ± 0.005) 및 기타 베이스라인을 크게 능가했다.
  • ROAR 평가에서 InputIBA는 중요한 특징을 정확히 식별하는 반면, DeepSHAP과 Integrated Gradients는 이를 실패하여 특징 중요도 탐지 능력이 뛰어나다는 것을 시사한다.
  • 입력 기반 정보 이론에 기반함에도 불구하고, InputIBA는 국소화에서 Guided Backpropagation 및 Extremal Perturbations와 유사한 성능을 보였다.
  • 이 방법은 시각(ImageNet) 및 NLP(IMDB) 작업 전반에서 뛰어난 일반화 능력을 보이며, 합성곱 아키텍처를 초월한 적용 가능성을 확인했다.
  • Sensitivity-N 및 Insertion-Deletion과 같은 민감도 기반 평가에서 강력한 성능을 보이며, 특징 기여도 측정의 신뢰성을 확인했다.
  • 모델 가중치나 훈련 동역학의 임의성에 의한 비정상적 결과가 아님을 보여주기 위해 파라미터 무작위화 실험에서도 성능가 안정성을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.