Skip to main content
QUICK REVIEW

[논문 리뷰] Theoretical and Practical Perspectives on what Influence Functions Do

Andrea Schioppa, Katja Filippova|arXiv (Cornell University)|2023. 05. 26.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 영향 함수(IFs)가 딥 네트워크에서 파라미터 분리로 인해 미세조정 단계의 짧은 창에만 모델 행동을 예측할 수 있음을 명확히 한다. 장기적인 하나 제외 재학습 효과를 예측하지 못함에도 불구하고, IFs는 영향력 있는 학습 예제를 식별하고 이러한 예제에 대해 소수의 단계로 타겟팅된 미세조정을 통해 잘못된 예측을 수정함으로써 모델 디버깅에 유용하다.

ABSTRACT

Influence functions (IF) have been seen as a technique for explaining model predictions through the lens of the training data. Their utility is assumed to be in identifying training examples "responsible" for a prediction so that, for example, correcting a prediction is possible by intervening on those examples (removing or editing them) and retraining the model. However, recent empirical studies have shown that the existing methods of estimating IF predict the leave-one-out-and-retrain effect poorly. In order to understand the mismatch between the theoretical promise and the practical results, we analyse five assumptions made by IF methods which are problematic for modern-scale deep neural networks and which concern convexity, numeric stability, training trajectory and parameter divergence. This allows us to clarify what can be expected theoretically from IF. We show that while most assumptions can be addressed successfully, the parameter divergence poses a clear limitation on the predictive power of IF: influence fades over training time even with deterministic training. We illustrate this theoretical result with BERT and ResNet models. Another conclusion from the theoretical analysis is that IF are still useful for model debugging and correcting even though some of the assumptions made in prior work do not hold: using natural language processing and computer vision tasks, we verify that mis-predictions can be successfully corrected by taking only a few fine-tuning steps on influential examples.

연구 동기 및 목표

  • 딥 네트워크에서 영향 함수(IFs)가 이론적으로는 유망하지만 실제로는 하나 제외 재학습(LSOR) 효과를 예측하지 못하는 데서 발생하는 괴리 현상을 해결하기 위해.
  • 현대 딥 러닝 환경에서 깨질 수 있는 IF 방법의 핵심 가정을 규명하고 분석하기 위해.
  • 특히, 미세조정 중에 파라미터 및 손실 변화를 기준으로 IFs가 현실적으로 무엇을 예측할 수 있는지 명확히 하기 위해.
  • 영향력 있는 예제에 대해 타겟팅된 미세조정을 통해 잘못된 예측을 수정함으로써 실용적인 모델 디버깅 응용을 검증하기 위해.
  • 파라미터 분리에 대한 이론적 경계를 설정하고, IF 예측이 시간이 지남에 따라 약화됨을 보여주어 그 예측 유효 기간을 제한함을 밝히기 위해.

제안 방법

  • IF 방법의 다섯 가지 핵심 가정에 대한 이론적 분석: 볼록성, 수치 안정성, 학습 경로 일관성, 손실 변화에 따른 파라미터 분리.
  • 정리 1의 증명: 헤시안 기반 IFs는 엄격한 볼록성이 없더라도 변화된 손실 함수에 대해 근처의 정류점에 근사할 수 있음.
  • 손실이 변화했을 때 학습 경로가 어떻게 분리되는지에 대한 이론적 분석(정리 2), 이는 시간이 지남에 따라 일차 근사가 무효화됨을 보여줌.
  • 이산 그론발레의 부등식을 사용한 파라미터 분리 상한선 유도(정리 3), 이는 IF 예측이 시간이 지남에 따라 악화됨을 보여줌.
  • BERT 및 ResNet 모델에서 IF의 예측 능력 감소를 실증적으로 검증하여, 시간이 지남에 따라 IF 순위와 LSOR 효과 간의 상관관계를 측정함.
  • 실용적인 수정 방법 두 가지 제안: 찬성자 수정(상위-k 영향력 있는 예제 재라벨링)과 반대자 튜닝(상위-k 반대 예제에 대한 미세조정), SST2 및 CIFAR10에서 최대 50단계의 미세조정을 통해 평가함.
(a)
(a)

실험 결과

연구 질문

  • RQ1딥 네트워크에서 영향 함수가 이론적으로는 타당한 근거를 지녔음에도 불구하고, 왜 하나 제외 재학습(LSOR) 효과를 예측하지 못하는가?
  • RQ2영향 함수 방법에서 깨지는 현대 딥 러닝 환경에서의 가정은 무엇이며, 이는 예측 정확도에 어떻게 영향을 미치는가?
  • RQ3손실이 변화한 상황에서 영향 함수는 파라미터 변화를 어느 정도 예측할 수 있으며, 이러한 예측은 얼마나 오래 유효한가?
  • RQ4장기적인 재학습 효과를 예측하지 못하더라도, 영향 함수는 여전히 모델 디버깅과 오류 수정에 실용적으로 유용한가?
  • RQ5시간이 지남에 따라 파라미터 분리가 영향 함수 예측의 신뢰성에 어떻게 영향을 미치며, 이는 이론적으로 경계될 수 있는가?

주요 결과

  • 영향 함수가 장기적인 LSOR 효과를 예측하지 못하는 주요 원인은 딥 네트워크에서 시간이 지남에 따라 파라미터 분리가 발생하기 때문이다. 이는 결정론적 학습 조건에서도 마찬가지이다.
  • 이론적 분석을 통해 볼록성과 수치 안정성 문제는 완화될 수 있지만, 파라미터 분리는 영향 함수의 예측 유효 기간을 근본적으로 제한함을 보여줌.
  • 이산 그론발레의 부등식을 사용해 파라미터 분리의 상한선을 도출하였으며, 실증 결과는 이 경계가 날카로워서 IF 예측의 정확도 감소를 설명함.
  • 영향 함수는 시간 제한이 있는, 미세조정 기반 수정 프rotocol를 통해 모델 디버깅에 여전히 효과적임: 영향력 있는 예제에 대해 몇 단계만 업데이트하여 잘못된 예측을 수정함.
  • SST2(BERT)에서 찬성자 수정과 반대자 튜닝은 무작위 기준보다 성능을 높이며, 성공률은 최대 2% 향상되고 평균적으로 필요한 미세조정 단계 수는 6% 감소함.
  • CIFAR10(ResNet)에서는 검색된 예제의 레이블 불일치로 인해 반대자 튜닝의 효과가 떨어지지만, 찬성자 수정은 여전히 수정 효율성을 향상시켜, 시간 제약 조건 하에서 IFs의 실용적 유용성을 확인함.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.