[논문 리뷰] Can We Faithfully Represent Masked States to Compute Shapley Values on a DNN?
이 논문은 딥 네ural 네트워크(DNNs)에서 샤플리 값 계산을 위한 최적의 기본값을 평가하고 학습하기 위해 원인 패턴 기반 프레임워크를 제안한다. DNNs에서 추출한 분리된 원인 패턴을 활용함으로써, 기본값은 입력 변수의 부재를 정확히 표현하여 부적절한 원인 효과와 중복된 패턴 설명을 최소화한다. 주요 기여는 이론적으로 탄탄하고 신뢰성에 기반한 접근으로, 할당 신뢰도를 향상시킨다.
Masking some input variables of a deep neural network (DNN) and computing output changes on the masked input sample represent a typical way to compute attributions of input variables in the sample. People usually mask an input variable using its baseline value. However, there is no theory to examine whether baseline value faithfully represents the absence of an input variable, \emph{i.e.,} removing all signals from the input variable. Fortunately, recent studies show that the inference score of a DNN can be strictly disentangled into a set of causal patterns (or concepts) encoded by the DNN. Therefore, we propose to use causal patterns to examine the faithfulness of baseline values. More crucially, it is proven that causal patterns can be explained as the elementary rationale of the Shapley value. Furthermore, we propose a method to learn optimal baseline values, and experimental results have demonstrated its effectiveness.
연구 동기 및 목표
- DNN 할당에서 사용되는 기본값이 입력 변수의 부재를 진정으로 표현하는지 평가하기 위한 이론적 기준이 부족한 문제를 해결하기 위해.
- 직관적 또는 OOD(외부 분포) 기본값이 본질적으로 부정확하다는 가정을 도전하기 위해, 원인 패턴 기반의 신뢰성 기준을 도입하기 위해.
- 중복된 원인 패턴 설명을 최소화하고 새로운 부적절한 패턴을 방지함으로써 최적의 기본값을 학습하는 방법을 제안하기 위해.
- 원인 패턴과 샤플리 값 간의 관계를 설정하고, 원인 패턴이 DNN의 기본 추론 논리임을 증명하기 위해.
제안 방법
- 이 방법은 DNN에 인코딩된 희박하고 기호적인 개념인 분리된 원인 패턴을 사용하여 입력 변수의 진정된 부재를 정의한다.
- 기본값의 신뢰성은 마스크된 입력에서 DNN 출력을 설명하기 위해 필요한 원인 패턴의 수를 최소화하는 방식으로 수식화된다.
- 최적의 기본값은 기존의 원인 효과의 총 강도를 최소화하면서 새로운 효과를 도입하지 않는 방식으로 학습된다.
- 잘못된 기본값은 동일한 영향을 설명하기 위해 지수적으로 많은 수의 중복된 원인 패턴을 유도함을 증명한다.
- 다중 순서 샤플리 값과 마진 효용을 활용하여 고차원 원인 상호작용을 분해하고 분석한다.
- 최소화되고 신뢰할 수 있는 원인 패턴 설명을 장려하는 손실 함수를 사용하여 할당의 정밀도를 향상시킨다.
실험 결과
연구 질문
- RQ1DNN 할당에서 사용되는 기본값이 부적절한 신호나 특징을 도입하지 않고도 입력 변수의 부재를 정확히 표현할 수 있는가?
- RQ2인간의 직관이나 분포 가정을 초월하여 기본값의 신뢰성을 이론적으로 평가할 수 있는 방법은 무엇인가?
- RQ3DNN 내 원인 패턴과 샤플리 값 할당 방법 간의 관계는 무엇인가?
- RQ4중복된 원인 패턴 설명을 최소화하는 최적의 기본값을 학습할 수 있는가?
- RQ5고차원 원인 효과는 다중 순서 샤플리 값과 마진 효용에서 어떻게 나타나는가?
주요 결과
- 잘못된 기본값은 동일한 영향을 설명하기 위해 지수적으로 많은 수의 중복된 원인 패턴을 유도하여 할당의 정밀도를 떨어뜨린다.
- OOD 특징를 도입하는 기본값이 반드시 OOD 네트워크 출력을 생성하는 것은 아니며, 이는 OOD 기본값이 항상 부정확하다는 가정을 도전한다.
- 최적의 기본값은 DNN 출력을 설명하기 위해 필요한 원인 패턴의 수를 최소화하며, 옥커의 면도 원칙과 일치한다.
- DNN에서 추출한 원인 패턴은 모든 2^n개의 마스크된 입력에서 네트워크 출력을 정확히 모방할 수 있으며, 이는 원인 패턴이 DNN의 기본 추론 논리임을 증명한다.
- 고차원 원인 효과는 고차원 샤플리 값과 마진 효용에만 존재하며, 표준 샤플리 값 손실보다 더 세밀한 분석이 가능하다.
- 제안된 방법은 중복 및 부적절한 원인 효과를 모두 감소시켜 할당의 정밀도를 크게 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.