[논문 리뷰] Fairwashing Explanations with Off-Manifold Detergent
논문은 분류기에 대한 설명 매핑이 출력 변화 없이 임의로 조작될 수 있음을 증명하고, 이러한 조작에 대해 설명을 더 강건하게 만들기 위해 접선공간 프로젝션을 제안한다. 그것은 미분 기하학을 사용한 이론적 증명을 제공하고 다양한 태스크와 아키텍처에서 실험적으로 검증한다.
Explanation methods promise to make black-box classifiers more transparent. As a result, it is hoped that they can act as proof for a sensible, fair and trustworthy decision-making process of the algorithm and thereby increase its acceptance by the end-users. In this paper, we show both theoretically and experimentally that these hopes are presently unfounded. Specifically, we show that, for any classifier $g$, one can always construct another classifier $ ilde{g}$ which has the same behavior on the data (same train, validation, and test error) but has arbitrarily manipulated explanation maps. We derive this statement theoretically using differential geometry and demonstrate it experimentally for various explanation methods, architectures, and datasets. Motivated by our theoretical insights, we then propose a modification of existing explanation methods which makes them significantly more robust.
연구 동기 및 목표
- 표준 설명이 모델 결정이 충실하게 반영되지 못할 위험성을 동기 부여한다.
- manifold 가정하에서 설명 맵의 조작 가능성을 이론적으로 증명한다.
- 조작된 설명이 성능을 유지하면서 원래와 다를 수 있음을 실험적으로 보여준다.
- 데이터 매니폴드의 접선 공간으로의 투영에 기초한 강건한 설명 방법을 제시하고 검증한다.
제안 방법
- 미분 기하학을 사용하여 설명이 데이터 매니폴드 밖으로 확장되어 임의의 목표와 일치하도록 만들 수 있으며, 데이터의 동작은 데이터 위에서 바뀌지 않는다는 것을 보인다.
- R^D에 매립된 d차원 데이터 매니폴드 S에 대해, 매니폴드에 직교하는 설명은 과소결정되어 임의의 목표 설명을 epsilon = d/D 한도 내로 재현하도록 제어될 수 있음을 증명한다.
- 접선 공간 프로젝션(tsp) 설명을 데이터 매니폴드의 접선 공간으로 그래디언트를 투영하여 정의한다.
- 고차원에서 tsp 설명을 추정하는 실용적 방법을 제시한다(Hyperplane 방법 및 Autoencoder 기반 방법).
- 실험적으로 MNIST, FashionMNIST, CIFAR-10에서 로지스틱 회귀 및 심층 네트워크에 대한 설명을 조작하여 강건한 조작 및 평가를 SSIM, PCC, MSE, and KL divergence로 수행한다.
실험 결과
연구 질문
- RQ1분류기의 설명이 데이터 매니폴드에서 데이터를 보존하지 않고도 조작될 수 있는가?
- RQ2데이터 매니폴드의 차원이 임베딩 공간에 비해 설명 조작가능성에 어떤 영향을 미치는가?
- RQ3접선 공간 프로젝션 설명이 조작에 대한 강건성을 증가시키는가?
- RQ4복잡한 데이터셋과 모델에 대해 실무적으로 접선 공간 투영을 어떻게 추정할 수 있는가?
- RQ5tsp 설명이 설명 유형(gradient, x ∘ Grad, Integrated Gradients, LRP) 및 태스크 간 일반화되는가?
주요 결과
- 설명은 대상 설명과 매우 비슷하게 매칭되도록 조작될 수 있으며(SSIM 약 0.8), 모델의 출력은 거의 동일하게 유지될 수 있다(출력 MSE 약 1e-3).
- 조작은 데이터 매니폴드에 직교하는 방향에 영향을 준다; 매니폴드 접선 방향의 그래디언트는 원래 모델과 조작된 모델 사이에서 일치한다.
- 접선 공간 프로젝션 설명은 조작에 훨씬 더 강건하여, 데이터 매니폴드에서 측정했을 때 원래 설명과 조작된 설명 간의 일치도가 높다.
- 로지스틱 회귀에서 평면 방향으로의 결정 경계 수정은 tsp 설명을 동일하게 남겨둔다(Pw-projected gradient).
- 두 가지 실용적 방법 제안: k-최근접 이웃을 이용한 하이퍼플레인 방법과 Jacobian의 SVD를 이용한 오토인코더 기반 방법으로, 다양한 데이터셋에서 tsp 설명 가능.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.