[논문 리뷰] Influence Functions in Deep Learning Are Fragile
이 논문은 딥 러닝에서 영향 함수의 신뢰성을 조사하며, 다양한 아키텍처와 데이터셋에서 영향 함수가 취약함을 입증한다. 대규모 실험을 통해 깊이가 깊어질수록 영향 추정치가 심각하게 악화되고, 가중치 감소와 아키텍처에 민감하며, 비볼록성과 헤시안 근사 오차로 인해 자주 부정확하다는 점을 보여주며, 비볼록 설정에서 개선된 추정기의 필요성을 제기한다.
Influence functions approximate the effect of training samples in test-time predictions and have a wide variety of applications in machine learning interpretability and uncertainty estimation. A commonly-used (first-order) influence function can be implemented efficiently as a post-hoc method requiring access only to the gradients and Hessian of the model. For linear models, influence functions are well-defined due to the convexity of the underlying loss function and are generally accurate even across difficult settings where model changes are fairly large such as estimating group influences. Influence functions, however, are not well-understood in the context of deep learning with non-convex loss functions. In this paper, we provide a comprehensive and large-scale empirical study of successes and failures of influence functions in neural network models trained on datasets such as Iris, MNIST, CIFAR-10 and ImageNet. Through our extensive experiments, we show that the network architecture, its depth and width, as well as the extent of model parameterization and regularization techniques have strong effects in the accuracy of influence functions. In particular, we find that (i) influence estimates are fairly accurate for shallow networks, while for deeper networks the estimates are often erroneous; (ii) for certain network architectures and datasets, training with weight-decay regularization is important to get high-quality influence estimates; and (iii) the accuracy of influence estimates can vary significantly depending on the examined test points. These results suggest that in general influence functions in deep learning are fragile and call for developing improved influence estimation methods to mitigate these issues in non-convex setups.
연구 동기 및 목표
- 비볼록 최적화 설정에서 딥 네ural 네트워크의 영향 함수의 신뢰성과 정확도를 평가하는 것.
- 네트워크의 깊이, 너비, 아키텍처, 정규화 기법이 영향 추정 품질에 미치는 영향을 조사하는 것.
- 헤시안 근사 방법과 모델 수렴도가 영향 추정의 정확성에 미치는 영향을 평가하는 것.
- 실제 딥 러닝 환경에서의 1차 영향 함수의 한계에 대한 경험적 증거를 제공하는 것.
- ResNet-50과 같은 대규모 모델에서 영향 함수를 설명 가능성 및 모델 디버깅에 사용할 수 있는지의 타당성을 검토하는 것.
제안 방법
- 얕은 네트워크(iris, mnist), 소형 CNN, 그리고 mnist, cifar-10, imagenet에서의 깊은 아키텍처(resnets)를 포함한 다양한 모델에서 영향 함수를 경험적으로 평가한다.
- 후행적으로 기울기와 헤시안-벡터 곱을 통한 1차 타일러 근사법을 사용해 영향 점수를 계산한다.
- 최적 모델 파라미터에서 재학습한 결과를 기반으로 한 참값 영향과 영향 추정치를 비교한다.
- Agarwal 등(2016)에서 제안한 방법과 유사한 무작위 헤시안-벡터 곱 근사법을 적용하고, 영향 추정의 오차를 평가한다.
- 피어슨 상관계수와 스피어만 순위 상관계수를 사용해 추정된 영향과 참값 영향 간의 상관관계를 측정한다.
- 최적 파라미터에서 재학습하는 전략이, 파라미터 노름 차이와 상관계수 안정성 측면에서, 처음부터 재학습하는 것에 대한 실용적인 대체 기준이 되는지 검증한다.
실험 결과
연구 질문
- RQ11차 영향 함수는 떼어내기 재학습에서 구한 참값 영향과 비교해 딥 네트워크에서 얼마나 정확한가?
- RQ2네트워크의 깊이와 너비는 비볼록 딥 러닝 설정에서 영향 추정의 신뢰성에 어떻게 영향을 미치는가?
- RQ3가중치 감소 정규화는 영향 추정 품질 향상에 어떤 역할을 하는가?
- RQ4헤시안 근사 기법은 대규모 모델에서 영향 추정 정확성에 어떻게 영향을 미치는가?
- RQ5테스트 포인트의 선택은 다양한 아키텍처와 데이터셋에서 영향 추정의 신뢰성에 어떻게 영향을 미치는가?
주요 결과
- 얕은 네트워크에서는 영향 추정이 상당히 정확하지만, 특히 imagenet에서의 resnet-50와 같이 깊은 아키텍처에서는 점점 더 잘못된 결과를 낳는다.
- 일부 아키텍처와 데이터셋에서는 가중치 감소 정규화가 높은 품질의 영향 추정을 얻는 데 필수적이다.
- 선택된 테스트 포인트에 따라 영향 추정의 정확도가 크게 달라지며, 이는 국소적 손실 곡면 기하학에 매우 민감함을 시사한다.
- 영향 추정에 사용되는 무작위 헤시안-벡터 곱 근사법은 자주 잘못된 결과를 낳으며, 이는 낮은 추정 품질의 주요 원인이다.
- 최적 파라미터에서 떼어내기 재학습을 통해 구한 참값 영향 추정치는 특히 resnet-50와 같은 대규모 모델에서 높은 변동성을 보이며, 재학습 기준의 불안정성을 시사한다.
- imagenet에서 추정된 영향과 참값 영향 간 상관계수는 매우 낮으며(0.15 이하), 최적 파arameter에서 재학습한 결과조차도 정렬이 잘 되어 있지 않음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.