Skip to main content
QUICK REVIEW

[논문 리뷰] Explaining Neural Networks via Perturbing Important Learned Features.

Ashkan Khakzar, Soroosh Baselizadeh|arXiv (Cornell University)|2019. 11. 25.
Explainable Artificial Intelligence (XAI)인용 수 7
한 줄 요약

이 논문은 중요한 은닉 뉴런(학습된 특징)을 식별하고, 이러한 뉴런만 유지하면서 입력을 변형하여 출력 변화를 최대화하는 새로운 입력 특징 기여도 방법인 PruneGrad를 제안한다. 고수준 특징에 집중함으로써 입력 요소 간의 상호의존성을 포착하여, 세 가지 벤치마크인 정상성 검사, 픽셀 변형, 그리고 제거 후 재학습(ROAR)에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Attributing the output of a neural network to the contribution of given input elements is one way of shedding light on the black box nature of neural networks. We propose a novel input feature attribution method that finds an input perturbation that maximally changes the output neuron by exclusively perturbing important hidden neurons (i.e. learned features) on the path to output neuron. Given an input, this is achieved by 1) pruning unimportant neurons, and subsequently 2) finding a local input perturbation that maximizes the output in the pruned network. Since our method considers the importance of hidden neurons (high-level features), it inherently considers interdependencies between multiple input elements, which is vital for input feature attribution. We propose PruneGrad, an efficient gradient-based solution for the pruning and perturbation steps of our method. The efficacy of our method is evaluated by quantitatively benchmarking against other attribution methods using 1) sanity checks, 2) pixel perturbation, and 3) Remove and Retrain (ROAR). Our results show that while most of the existing attribution methods are prone to fail or get mediocre results in at least one benchmark, our proposed method achieves state of the art results in all three benchmarks. The results are further supported by comparative visual evaluation.

연구 동기 및 목표

  • 기존의 입력 특징 기여도 방법들이 입력 요소 간의 상호의존성을 포착하지 못하는 한계를 해결하기 위해.
  • 원시 입력 특징이 아닌 고수준의 중요한 은닉 뉴런에 집중하여 모델 출력을 기여도 기반으로 분석하는 방법을 개발하기 위해.
  • 원리적인 프루닝과 기울기 기반 변형을 통해 기여도의 강건성과 신뢰성을 향상시키기 위해.
  • 정상성 검사, 픽셀 변형, 제거 후 재학습(ROAR)을 포함한 다양한 벤치마크를 통해 메서드를 종합적으로 평가하기 위해.

제안 방법

  • 이 방법은 먼저 출력 뉴런에 기여하는 바가 큰 은닉 뉴런만 유지하고, 중요도가 낮은 뉴런은 제거한다.
  • 그 후, 프루닝된 네트워크에서 출력을 최대화하는 국소적 입력 변형을 수행하며, 유지된 특징에 영향을 주는 입력에 집중한다.
  • PruneGrad는 프루닝된 네트워크의 구조를 유지하면서도 효율적으로 변형을 계산하기 위해 기울기 기반 최적화를 사용한다.
  • 개별 입력 단위가 아닌 고수준 특징에서 작동함으로써 입력 요소 간의 상호의존성을 자연스럽게 모델링한다.
  • 네트워크의 내부 표현을 활용하여 의미적으로 유의미한 입력 변화를 유도하는 변형을 이끈다.
  • 효율성과 확장성을 고려하여 대규모 신경망에 적용 가능한 설계가 되어 있다.

실험 결과

연구 질문

  • RQ1학습된 은닉 뉴런에서 작동하는 기여도 방법이 기존 방법보다 더 의미 있는 입력 기여도를 포착할 수 있는가?
  • RQ2기여도 신뢰성을 시험하는 철저한 정상성 검사에서 이 방법의 성능은 어떠한가?
  • RQ3입력 특징을 제거하고 모델을 재학습하는 조건(ROAR 벤치마크)에서 이 방법은 어느 정도의 성능 유지 능력을 보이는가?
  • RQ4원시 입력 특징 기반 방법과 비교해 볼 때, 이 방법이 입력 요소 간의 상호의존성을 더 잘 포착하는가?
  • RQ5이 제안된 방법은 최신 기술 수준의 기여도 기법과 정량적·정성적으로 비교해 볼 때 어떻게 다른가?

주요 결과

  • PruneGrad는 정상성 검사, 픽셀 변형, 제거 후 재학습(ROAR)이라는 세 가지 벤치마크에서 모두 최신 기술 수준의 성능을 달성한다.
  • 대부분의 기존 방법들이 세 평가 벤치마크 중 어느 하나에서나 실패하거나 평균 수준의 성능을 보이는 데 비해, PruneGrad는 어느 하나에서도 성능이 떨어지지 않는다.
  • 다양한 평가 프로토콜에서 일관되게 높은 성능를 유지함으로써 뛰어난 강건성을 입증한다.
  • 시각적 평가 결과, PruneGrad는 베이스라인 대비 더 현실적이며 의미적으로 더 유의미한 기여도 맵을 생성함을 확인하였다.
  • 개별 픽셀이나 입력 단위가 아닌 고수준 특징에서 작동함으로써 입력 요소 간의 상호의존성을 효과적으로 포착한다.
  • 제거 실험(ablation study) 결과, 변형 이전에 중요한 뉴런을 프루닝하는 것이 정확한 기여도 분석에 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.