Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Deep Learning Interpretability by Saliency Guided Training

Aya Abdelsalam Ismail, Héctor Corrada Bravo|arXiv (Cornell University)|2021. 11. 29.
Explainable Artificial Intelligence (XAI)인용 수 10
한 줄 요약

이 논문은 깊이 있는 신경망에서 노이즈가 많은 기울기 문제를 줄이기 위해 저기여도가 낮은 특징을 반복적으로 마스킹하면서도 모델 성능을 유지하는 새로운 학습 절차인 '기여도 유도 학습'을 제안한다. 원본 입력과 마스킹된 입력에 대한 예측 간의 KL 발산을 최소화함으로써, 시각, 자연어 처리(NLP), 시계열 작업 전반에서 더 흐린, 더 신뢰할 수 있는 기여도 맵을 생성한다. 정확도를 희생시키지 않고도 이루어진다.

ABSTRACT

Saliency methods have been widely used to highlight important input features in model predictions. Most existing methods use backpropagation on a modified gradient function to generate saliency maps. Thus, noisy gradients can result in unfaithful feature attributions. In this paper, we tackle this issue and introduce a {\it saliency guided training}procedure for neural networks to reduce noisy gradients used in predictions while retaining the predictive performance of the model. Our saliency guided training procedure iteratively masks features with small and potentially noisy gradients while maximizing the similarity of model outputs for both masked and unmasked inputs. We apply the saliency guided training procedure to various synthetic and real data sets from computer vision, natural language processing, and time series across diverse neural architectures, including Recurrent Neural Networks, Convolutional Networks, and Transformers. Through qualitative and quantitative evaluations, we show that saliency guided training procedure significantly improves model interpretability across various domains while preserving its predictive performance.

연구 동기 및 목표

  • 의료 및 자율주행 시스템과 같은 중요한 분야에서 모델의 해석 가능성성을 저해하는 노이즈가 많고 신뢰도가 떨어지는 기여도 맵 문제를 해결한다.
  • 기울기 역전파에서 유래한 노이즈가 많은 기울기에 의존하는 기존 기여도 방법의 한계를 극복한다. 특히 기울기 소실 문제로 설명 품질이 떨어지는 RNN과 같은 모델에서 특히 그렇다.
  • 지식 기반 설명이나 사후 보정이 필요 없이, 본질적으로 더 깔끔하고 신뢰할 수 있는 기여도 맵을 생성하는 학습 절차를 개발한다.
  • CNN, RNN, 트랜스포머, TCN 등 다양한 아키텍처에서 예측 성능를 유지하면서도 해석 가능성성을 향상시킨다.
  • 제안된 프레임워크로 학습한 후 표준 기여도 방법을 사용하여, 이미지, 텍스트, 다변량 시계열 데이터 모odal 전반에 걸쳐 일반화 가능성을 입증한다.

제안 방법

  • 기울기 크기가 낮은(즉, 중요도가 낮은) 특징을 반복적으로 마스킹함으로써 기울기 기반 기여도 맵의 노이즈를 줄이는 학습 과정을 적용한다.
  • 표준 예측 손실과 원본 입력 및 마스킹된 입력에 대한 모델 출력 간의 KL 발산을 포함하는 병합 손실 함수를 최적화한다.
  • 마스킹 과정에서 특징 선택에는 순수한 기울기(바닐라 기울기)를 사용하지만, 사후에 여러 기여도 방법(예: 통합 기울기, DeepLIFT, DeepSHAP)의 해석 가능성성을 향상시킨다.
  • 확률적 경사 하강법을 사용해 모델을 엔드 투 엔드로 학습하며, 기울기 크기 기준 임계값을 기반으로 각 학습 단계에서 마스킹을 적용한다.
  • 하이퍼파rameter λ(정규화 강도)와 k(마스킹할 특징의 비율)를 통해 마스킹를 제어함으로써, 흐린 정도와 성능 사이의 트레이드오���을 가능하게 한다.
  • CNN(이미지 분류용), RNN(순차적 데이터용), 트랜스포머(NLP용), TCN(시계열용) 등 다양한 아키텍처에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1사후 보정이나 고차 기울기 계산에 의존하지 않고도, 기여도 맵의 기울기 노이즈를 본질적으로 줄일 수 있는 학습 절차를 설계할 수 있는가?
  • RQ2기여도 유도 학습이 이미지, 텍스트, 시계열 등 다양한 데이터 모달 전반에서 기여도 맵의 정확성과 흐린 정도를 향상시키는가?
  • RQ3RNN에서 자주 발생하는 기울기 소실 문제로 인해 설명이 무의미해지는 문제를 어느 정도 완화할 수 있는가?
  • RQ4재학습 없이도 여러 기여도 방법(예: 통합 기울기, DeepSHAP)에 대해 기여도 유도 학습의 이점을 일반화할 수 있는가?
  • RQ5예측 성능를 유지하면서도, 사실 추출 및 감성 분석 작업에서 AUP 및 AUR 등의 해석 가능성 지표를 크게 향상시킬 수 있는가?

주요 결과

  • 이미지 분류 작업에서 기여도 유도 학습은 시각적 기여도 노이즈를 줄였고, 더 흐릿하고 해석 가능한 맵을 생성하였다. 정성적 비교를 통해 이를 입증하였다.
  • 감성 분석 및 사실 추출 작업에서, 설명의 포괄성을 향상시켰으며, 다양한 기여도 방법에서 AUP 및 AUR 지표에 상당한 향상이 있었다.
  • 다변량 시계열 분류 작업에서는 기여도 맵의 정밀도와 재현율을 모두 향상시켰고, 특히 DeepSHAP 및 통합 기울기 방법과 조합했을 때 가장 높은 성능를 기록하였다.
  • RNN에서 기여도 유도 학습은 기울기 소실 문제를 효과적으로 완화하였으며, 순차적 작업에서 더 일관되고 의미 있는 기울기 기여도가 관찰되었다.
  • 기여도 유도 학습과 조합했을 때, 통합 기울기 및 DeepSHAP는 RareFeature에서 최고의 정밀도(0.239 AUP)를 기록하였고, 통합 기울기 및 DeepLift는 최고의 재현율 성능를 보였다.
  • Transformer 모델에서는 기존 학습 방식이 Gradient SHAP에서 더 높은 정밀도를 보였지만, 기여도 유도 학습은 모든 기여도 방법에서 재현율을 향상시켰고, 통합 기울기 방법이 가장 높은 재현율(Moving Rare Feature에서 0.171 AUR)을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.