Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Deep Attribution Priors Based On Prior Knowledge

Ethan Weinberger, Joseph D. Janizek|arXiv (Cornell University)|2019. 12. 20.
Explainable Artificial Intelligence (XAI)참고 문헌 41인용 수 5
한 줄 요약

이 논문은 메타특징에서 글로벌 특징 중요도로의 매핑을 함께 학습하고, 딥 모델이 이러한 학습된 사전 지식과 일치하는 국소적 기여도를 생성하도록 정규화하는 Deep Attribution Prior (DAPr) 프레임워크를 제안한다. 메타특징에 담긴 사전 지식을 활용함으로써 DAPr는 데이터가 적은 환경에서 일반화 성능을 향상시키고, 더 이해하기 쉬운 인간이 이해할 수 있는 모델 설명을 가능하게 한다.

ABSTRACT

Feature attribution methods, which explain an individual prediction made by a model as a sum of attributions for each input feature, are an essential tool for understanding the behavior of complex deep learning models. However, ensuring that models produce meaningful explanations, rather than ones that rely on noise, is not straightforward. Exacerbating this problem is the fact that attribution methods do not provide insight as to why features are assigned their attribution values, leading to explanations that are difficult to interpret. In real-world problems we often have sets of additional information for each feature that are predictive of that feature's importance to the task at hand. Here, we propose the deep attribution prior (DAPr) framework to exploit such information to overcome the limitations of attribution methods. Our framework jointly learns a relationship between prior information and feature importance, as well as biases models to have explanations that rely on features predicted to be important. We find that our framework both results in networks that generalize better to out of sample data and admits new methods for interpreting model behavior.

연구 동기 및 목표

  • 딥 러닝 모델에서 특징 기여도 방법이 의미 있는, 잡음 기반 설명이 아닌 설명을 생성하도록 보장하는 도전 과제를 해결한다.
  • 기존 기여도 방법이 특징이 특정 기여도 값을 받는 *이유*를 설명하지 못하는 한계를 극복한다.
  • 유용한 메타특징(예: 유전자 경로, 영화 장르 등)을 활용하여 수작업으로 만든 도메인 규칙이 필요 없이 모델 학습을 안내한다.
  • 의료와 같은 고위험 도메인에서 표본 수가 적은 상황에서 모델의 일반화 성능을 향상시킨다.
  • 기존의 도메인 지식과 일치하는 메타특징에서 특징 중요도 관계를 학습함으로써 새로운 해석 가능성 방법을 가능하게 한다.

제안 방법

  • 메타특징을 입력으로 사용하여 글로벌 특징 중요도를 예측하는 별도의 사전 모델을 훈련한다.
  • 국소 기여도가 예측된 글로벌 중요도 값에 가까워지도록 유도하는 미분 가능한 손실 페널티를 도입한다.
  • 훈련 중에 예측 모델과 사전 모델을 엔드 투 엔드로 함께 최적화한다.
  • 유전자 경로, 질병 연관성, 영화 메타데이터 등의 메타특징을 사용하여 도메인 관련 사전 지식을 인코딩한다.
  • 합성 데이터와 두 가지 실제 생물학적 데이터셋(Acute Myeloid Leukemia [AML] 및 알츠하이머병)에 프레임워크를 적용한다.
  • 기여도 사전 지식의 해석 가능성은 알려진 생물학적 경로에서 상위 순위 특징의 풍부도를 점검함으로써 검증한다.

실험 결과

연구 질문

  • RQ1메타특징을 사용하여 데이터가 적은 환경에서 성능을 향상시키는 일반화 가능한 특징 중요도 사전 지식을 학습할 수 있는가?
  • RQ2기본 기여도 방법에 비해 DAPr 프레임워크가 더 해석 가능하고 신뢰할 수 있는 모델 설명을 제공하는가?
  • RQ3학습된 메타특징에서 특징 중요도 관계는 알려진 생물학적 또는 도메인 전문 지식과 일치하는가?
  • RQ4일반화성과 내성 면에서 DAPr는 기존 정규화 기반 기여도 방법보다 어떻게 비교되는가?
  • RQ5전문가가 정의한 정규화 함수가 필요 없이 DAPr 프레임워크는 다양한 도메인에 얼마나 넓게 적용 가능한가?

주요 결과

  • DAPr로 훈련된 모델은 특히 훈련 데이터가 제한된 경우 검증 데이터에 대해 더 나은 일반화 성능을 달성한다.
  • DAPr 프레임워크는 AML 관련 경로에서의 유의미한 풍부도를 보여줌으로써 알려진 생물학적 경로와 일치하는 메타특징에서 특징 중요도 관계를 성공적으로 학습한다.
  • 잡음 기반 DAPr 모델은 FDR 보정 후 유의미한 경로 풍부도를 보이지 않았지만, AML 드라이버 DAPr 모델은 여러 알려진 AML 연관 경로를 포착했다.
  • 사전 모델은 명시적인 인간이 수작업으로 만든 규칙이 없이도 의미 있는 특징 중요도 패턴을 독립적으로 학습했다.
  • 프레임워크는 인간이 이해할 수 있는 설명을 제공함으로써 특정 특징이 왜 중요하게 여겨지는지에 대한 이유를 제공함으로써 새로운 해석 가능성 방법을 가능하게 한다.
  • DAPr는 소규모 데이터셋에서의 임의의 상관관계와 잡음을 줄임으로써 모델 신뢰도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.