Skip to main content
QUICK REVIEW

[논문 리뷰] Consistent Counterfactuals for Deep Models

Emily Black, Zifan Wang|arXiv (Cornell University)|2021. 10. 06.
Explainable Artificial Intelligence (XAI)참고 문헌 57인용 수 7
한 줄 요약

이 논문은 가중치 초기화 및 데이터 변동과 같은 소규모 학습 변동에 대해 딥 모델에 대해 일관된 역설적 설명을 생성하는 데 목적이 있는 Stable Neighbor Search(SNS)를 제안한다. 국소 리프시츠 상수의 값이 낮고 예측 신뢰도가 높은 영역에서 역설적 설명을 우선적으로 고려함으로써, SNS는 유사한 모델 간에 상당히 높은 일관성을 달성하면서도 역설적 설명 비용을 낮게 유지하여, 표본 데이터 기반 벤치마크에서 기존 방법보다 안정성과 신뢰성 면에서 뛰어난 성능을 보인다.

ABSTRACT

Counterfactual examples are one of the most commonly-cited methods for explaining the predictions of machine learning models in key areas such as finance and medical diagnosis. Counterfactuals are often discussed under the assumption that the model on which they will be used is static, but in deployment models may be periodically retrained or fine-tuned. This paper studies the consistency of model prediction on counterfactual examples in deep networks under small changes to initial training conditions, such as weight initialization and leave-one-out variations in data, as often occurs during model deployment. We demonstrate experimentally that counterfactual examples for deep models are often inconsistent across such small changes, and that increasing the cost of the counterfactual, a stability-enhancing mitigation suggested by prior work in the context of simpler models, is not a reliable heuristic in deep networks. Rather, our analysis shows that a model's local Lipschitz continuity around the counterfactual is key to its consistency across related models. To this end, we propose Stable Neighbor Search as a way to generate more consistent counterfactual explanations, and illustrate the effectiveness of this approach on several benchmark datasets.

연구 동기 및 목표

  • 소규모 학습 변화(예: 다른 난수 시드 또는 한 개의 데이터 포인트를 제외한 경우)가 있는 딥 모델 간에 역설적 설명의 일관성 여부를 조사하는 것.
  • 단순한 모델에서 유용한 히ュ리스틱으로 사용되는 역설적 설명 비용 증가가 딥 네트워크에서 일관성 향상에 기여하는지 평가하는 것.
  • 특히 딥 러닝 환경에서 모델 변형에 대한 역설적 설명의 안정성에 대한 신뢰할 수 있는 지표를 규명하는 것.
  • 유사한 모델 변종 간에 일관성 있고 비용 효율적인 역설적 설명을 생성하는 데 목적이 있는 새로운 방법을 개발하고 검증하는 것.

제안 방법

  • 국소 리프시츠 상수의 값이 낮고 모델 신뢰도가 높은 영역에서 역설적 설명을 찾는 검색 기반 방법인 Stable Neighbor Search(SNS)를 제안한다.
  • 후보 역설적 설명 주변의 국소 리프시츠 상수를 정의하고 계산하여 모델 가중치 및 데이터 변형에 대한 민감도를 추정한다.
  • 모델 출력 로짓에서의 신뢰도 점수를 사용하여 모델 파rameter의 미세한 변화에 강건한 역설적 설명을 우선순위로 정한다.
  • 기존의 역설적 설명 생성 방법(예: min-ℓ₁, min-ℓ₂, PGD) 위에 SNS를 후처리 단계로 통합하여 일관성을 향상시킨다.
  • 원본 입력과의 거리 최소화, 신뢰도 최대화, 국소 리프시츠 상수 최소화를 목표로 하는 검색 목적 함수를 수립한다.
  • 다양한 시드와 데이터 서브셋을 사용한 100번의 재학습을 통해 표본 데이터 기반 벤치마크 데이터셋(German Credit, Seizure, CTG, Warfarin, HELOC, Taiwanese Credit)에서 SNS를 실증적으로 평가한다.

실험 결과

연구 질문

  • RQ1표준 방법으로 생성된 역설적 설명은 소규모 학습 변화가 있는 딥 모델 간에 얼마나 일관성 있는가?
  • RQ2역설적 설명 비용을 증가시키는 것이 딥 네트워크에서 유사한 모델 간에 일관성을 확실하게 향상시키는가?
  • RQ3리프시츠 연속성 및 예측 신뢰도와 같은 모델 성질 중 어떤 것이 모델 변형에 대한 역설적 설명 일관성 예측에 기여하는가?
  • RQ4낮은 국소 리프시츠 상수와 높은 신뢰도를 우선순위로 삼는 검색 전략이 비용 최소화 전략보다 더 높은 일관성을 달성할 수 있는가?
  • RQ5제안된 Stable Neighbor Search(SNS) 방법은 기존의 역설적 설명 생성 기법과 비교해 일관성과 비용 측면에서 어떻게 다른가?

주요 결과

  • 표준 역설적 설명 생성 방법은 소규모 학습 변화가 있는 모델 간에 낮은 일관성을 보이며, German Credit 데이터셋에서 최대 78%의 무효화율을 보였다.
  • 딥 모델에서는 역설적 설명 비용을 증가시키는 것만으로는 일관성을 확보할 수 없으며, 높은 비용의 예시조차도 자주 유사한 모델 간에 일반화되지 못한다.
  • 낮은 국소 리프시츠 상수 영역과 높은 모델 신뢰도 영역에 위치한 역설적 설명은 상당히 높은 일관성을 보이며, SNS를 사용할 경우 모든 데이터셋에서 무효화율이 0.00±0.00으로 떨어졌다.
  • SNS는 기존 기준 방법 대비 최대 50%까지 역설적 설명 비용을 감소시켰으며, 근사적으로 무효화율이 0에 수렴하는 결과를 달성했다. 예를 들어, Taiwanese Credit에서 ℓ₂ 비용은 SNS 기반 2.78±0.49이며, Pawelczyk 등에 비해 4.24±2.23이다.
  • SNS는 min-ℓ₁, min-ℓ₂ 및 PGD 기반 기준 방법에 적용했을 때 모든 데이터셋과 재학습 시나리오에서 근사적으로 완벽한 일관성(0.00±0.00 무효화율)을 달성했다.
  • 이론적 분석을 통해 작은 리프시츠 상수와 높은 신뢰도가 모델 미세조정 시 결정 경계의 변화를 제한함을 확인하였으며, 이는 SNS의 실증적 성공을 설명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.