Skip to main content
QUICK REVIEW

[논문 리뷰] Estimating Training Data Influence by Tracing Gradient Descent

Garima Pruthi, Frederick Liu|arXiv (Cornell University)|2020. 02. 19.
AI and HR Technologies인용 수 121
한 줄 요약

TracIn은 훈련 데이터가 테스트 예측에 미치는 영향을 훈련 반복 동안의 1차 기여도(gradient) 합산으로 추적하여, 모델과 작업 간에 사용 가능한 확장 가능한 체크포인트 기반 영향 지표를 제공합니다.

ABSTRACT

We introduce a method called TracIn that computes the influence of a training example on a prediction made by the model. The idea is to trace how the loss on the test point changes during the training process whenever the training example of interest was utilized. We provide a scalable implementation of TracIn via: (a) a first-order gradient approximation to the exact computation, (b) saved checkpoints of standard training procedures, and (c) cherry-picking layers of a deep neural network. In contrast with previously proposed methods, TracIn is simple to implement; all it needs is the ability to work with gradients, checkpoints, and loss functions. The method is general. It applies to any machine learning model trained using stochastic gradient descent or a variant of it, agnostic of architecture, domain and task. We expect the method to be widely useful within processes that study and improve training data.

연구 동기 및 목표

  • 개별 훈련 예제가 특정 테스트 예측에 어떤 영향을 미치는지 정량화할 필요성을 제시합니다.
  • 실용적인 gradient 기반 영향 측정 도구로 TracIn을 소개합니다.
  • 1차 근사, 체크포인트, 선택적 계층을 사용한 확장 가능한 구현을 제공합니다.
  • TracIn이 아키텍처, 도메인, SGD 기반 학습 전반에 일반화됨을 보여줍니다.
  • 데이터 정리 및 잘못 표기된 데이터 탐지와 같은 응용을 제안합니다.

제안 방법

  • TracIn을 훈련 예제가 사용된 반복들에서의 1차 그래디언트 도트 곱의 합으로 정의합니다: TracIn(z, z') = sum_t or minibatch t of eta_t * grad l(w_t, z') · grad l(w_t, z).
  • 미니배치에 대해 1/b 스케일링을 적용하여 확장합니다: TracIn(z, z') = (1/b) sum_t: z in B_t eta_t grad l(w_t, z') · grad l(w_t, z).
  • 업데이트당 테스트 손실 변화의 이상화된 영향력을 1차 테일러 확장으로 근사합니다.
  • 체크포인트를 사용하여 훈련 단계를 재생하고 선택된 체크포인트에서 기울기를 합산하는 TracInCP를 도입합니다: TracInCP(z, z') = sum_i eta_i grad l(w_{t_i}, z) · grad l(w_{t_i}, z').
  • 계층 선택 및 계산을 줄이면서도 정보 신호를 보존하는 체크포인트 사용에 대한 실용적인 지침을 제공합니다.

실험 결과

연구 질문

  • RQ1개별 훈련 예제가 gradients를 사용해 특정 테스트 예측에 어떤 영향을 미치는지 정량화할 수 있습니까?
  • RQ2체크포인트 기반의 1차 근사로 모델 및 작업 전반에 걸쳐 훈련 데이터 영향의 확장 가능하고 정확한 측정치를 제공합니까?
  • RQ3TracIn은 잘못 표기된 데이터나 테스트 예측에 가장 큰 영향을 미치는 데이터 포인트를 식별하는 데 기존 영향 방법(e.g., influence functions, representer point selection)과 비교해 어떤 차이가 있습니까?
  • RQ4실제 훈련 파이프라인에서의 정확도와 유용성에 영향을 주는 실용적 고려사항(미니배치 처리, 계층 선택, 학습률 스케줄)은 무엇입니까?

주요 결과

  • TracIn은 CIFAR-10 및 MNIST 실험에서 잘못 표기된 훈련 데이터를 식별하는 데 영향 함수와 representer points보다 우수합니다.
  • 체크포인트를 사용하는 TracInCP를 이용하면 초기에 잘못 표기된 데이터의 상당 부분을 순위에서 빠르게 회수할 수 있습니다(예: CIFAR-10에서 상위 20%에서 80% 이상 회수).
  • 1차 근사는 실제 손실 변화와 높은 상관관계를 보이며, MNIST 실험에서 Pearson 상관계수는 약 0.978에 달합니다.
  • 다른 체크포인트들이 보완적 정보를 제공하며, 높은 손실 감소를 가진 체크포인트를 샘플링하면 신호가 개선됩니다.
  • TracIn은 ImageNet의 ResNet-50 같은 대형 모델에 확장 가능하며, Gradients를 저차원 표현으로 투영하는 방식으로 동작할 수 있습니다(FC 계층의 rank-1 gradient 구조).
  • TracIn은 테스트 예측에 대한 가설자(positive influence)와 반대자(negative influence)에 대한 해석 가능한 통찰을 제공하며 잘못 표기된 데이터를 수정하는 등 데이터 중심의 개선에 도움을 줄 수 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.