Skip to main content
QUICK REVIEW

[논문 리뷰] YASENN: Explaining Neural Networks via Partitioning Activation Sequences

Yaroslav Zharov, Denis Korzhenkov|arXiv (Cornell University)|2018. 11. 07.
Explainable Artificial Intelligence (XAI)참고 문헌 33인용 수 3
한 줄 요약

YASENN는 계층별 그래디언트 부스팅 결정 트리로 활성화 시퀀스를 이산 스트림으로 분할하여 피드포워드 신경망을 해석하는 모델 특화 방법이다. 입력을 트리의 리프 인덱스 시퀀스로 인코딩함으로써 로지스틱 회귀와 같은 후행 모델을 통한 해석 가능한 분석이 가능하며, 부정적 어휘의 부재에 의존하는 등 세밀한 의사결정 패턴을 드러내지만, 저비용 계산과 결정론적 학습을 유지한다.

ABSTRACT

We introduce a novel approach to feed-forward neural network interpretation based on partitioning the space of sequences of neuron activations. In line with this approach, we propose a model-specific interpretation method, called YASENN. Our method inherits many advantages of model-agnostic distillation, such as an ability to focus on the particular input region and to express an explanation in terms of features different from those observed by a neural network. Moreover, examination of distillation error makes the method applicable to the problems with low tolerance to interpretation mistakes. Technically, YASENN distills the network with an ensemble of layer-wise gradient boosting decision trees and encodes the sequences of neuron activations with leaf indices. The finite number of unique codes induces a partitioning of the input space. Each partition may be described in a variety of ways, including examination of an interpretable model (e.g. a logistic regression or a decision tree) trained to discriminate between objects of those partitions. Our experiments provide an intuition behind the method and demonstrate revealed artifacts in neural network decision making.

연구 동기 및 목표

  • 의료, 금융, 자율주행 시스템과 같은 고위험 분야에서 모델 투명성이 법적·윤리적으로 필수적인 해석 가능한 딥러닝의 핵심 필요성을 해결하기 위해.
  • 기존 해석 방법의 한계를 극복하기 위해 — 기존 기반 기반 방법의 불안정성, 모델에 종속되지 않은 방법의 모델 특화 통찰력 부족, 내재적으로 해석 가능한 네트워크의 아키텍처 제약.
  • 내부 신경망 메커니즘을 활용해 더 정확하고 신뢰할 수 있는 해석을 가능하게 하되, 네트워크 아키텍처에 종속되지 않도록 하는 방법을 개발하기 위해.
  • 규제 또는 안전 중심 응용 분야처럼 해석 오류에 대한 용납 수준이 낮은 환경에서도 인간이 이해할 수 있는 설명을 명시적으로 제공하기 위해.
  • 활성화 시퀀스의 구조적 분할을 통해 신경망의 의사결정 패턴을 체계적으로 분석하고 기술하는 방법을 제공하기 위해.

제안 방법

  • YASENN는 각 은닉층에 대응하는 계층별 그래디언트 부스팅 결정 트리 앙상블을 사용해 훈련된 신경망을 휘발시킨다. 각 트리는 해당 레이어의 뉴런 활성화 값을 입력으로 사용한다.
  • 각 입력 샘플에 대해, 모든 트리의 리프 인덱스 시퀀스를 수집하여 입력 공간을 이산 스트림 또는 클러스터로 분할하는 고유한 코드를 형성한다.
  • 고유 코드의 유한한 수는 입력 공간의 이산적 분할을 유도하며, 각 분할은 레이어 간에 다른 활성화 패턴에 대응한다.
  • 각 분할(코드)은 인간이 이해할 수 있는 모델 — 로지스틱 회귀 또는 결정 트리 — 를 사용해 분류하도록 훈련하여, 서로 다른 분할에 속한 샘플 간의 구분을 가능하게 한다.
  • 왜곡된 특징 공간 및 낮은 오류 용납도가 요구되는 해석 작업을 위해, 휘발화 오차 분석 및 코드 선택 개선을 통해 확장 기능을 지원한다.
  • 그래디언트 부스팅 트리의 사용으로 인해 방법은 결정론적이며 효율적이며, 다른 휘발화나 샘플링 기반 방법에서 흔히 볼 수 있는 확률적 성격을 피한다.

실험 결과

연구 질문

  • RQ1활성화 시퀀스의 공간을 이산적이고 해석 가능한 스트림으로 분할하면, 신경망 의사결정에서 의미 있고 인간이 이해할 수 있는 패턴을 드러낼 수 있는가?
  • RQ2YASENN의 모델 특화 휘발화 접근 방식은 정밀도, 안정성, 해석 가능성 측면에서 모델에 종속되지 않은 방법보다 어떻게 비교되는가?
  • RQ3YASENN은 부정적 어휘의 존재가 아니라 부재에 의존하는 등의 미세한 의사결정 오류 패턴을 어느 정도 탐지하고 설명할 수 있는가?
  • RQ4YASENN은 아키텍처 제약 없이 표본 및 순차적 데이터를 포함한 다양한 데이터 유형과 작업에 효과적으로 적용될 수 있는가?
  • RQ5YASENN은 해석 오류에 대한 용납 수준이 낮은 환경에서 어떻게 성능을 발휘하며, 오차 인식 기반 개선 메커니즘을 통해 향상시킬 수 있는가?

주요 결과

  • YASENN은 텍스트 분류 작업에서 모델이 긍정 클래스에 대해 높은 확률을 예측했지만, 그 배경 논리가 다름을 드러낸 두 가지 다른 스트림을 성공적으로 식별했다: 한 스트림은 긍정어의 존재에 의존하고, 다른 스트림은 부정어의 부재에 의존한다.
  • 이 방법은 한 스트림에서 신경망의 의사결정이 명시적인 긍정 감성에 기반하지 않고 오히려 부정어의 부재에 기반한다는 점을 드러내어 의사결정 논리의 취약성을 시사한다.
  • 각 스트림에 대해 개별적으로 훈련한 일대다 로지스틱 회귀 모델은 AUC 점수 0.95와 0.89를 기록하여, 분할된 스트림이 분류적으로 유의미하고 구분 가능한 것을 확인했다.
  • 휘발화 과정이 모델을 본질적으로 정규화하므로, 노이즈에 대한 강건성과 수정된 입력 다양체에 대한 적응성이 뛰어나다는 것을 입증했다.
  • YASENN의 결정론적 훈련과 결정 트리의 사용으로 인해 모델 특화 통찰력을 손상시키지 않으면서도 빠르고 재현 가능하며 복잡도가 낮은 해석이 가능했다.
  • 다양한 레이어 간 활성화 패턴이 비슷한 예측을 낳을 수 있음을 드러내어, 최종 출력만을 분석하는 것이 아니라 전체 활성화 시퀀스를 분석하는 것이 중요하다는 점을 강조했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.