Skip to main content
QUICK REVIEW

[논문 리뷰] Data Cleansing for Models Trained with SGD

Satoshi Hara, Atsushi Nitanda|arXiv (Cornell University)|2019. 06. 01.
Machine Learning and Data Classification인용 수 14
한 줄 요약

이 논문은 확률적 경사하강법(SGD)으로 훈련된 모델을 위한 도메인에 관계없는 데이터 정제 방법을 제안한다. 이 방법은 SGD 단계를 역행하여 중간 모델을 활용함으로써 영향력 있는 훈련 인스턴스를 식별한다. 이 접근법은 전문 지식이 없이도 비전문가가 모델 정확도를 향상시킬 수 있도록 하며, MNIST와 CIFAR10에서 영향력 있는 인스턴스를 제거함으로써 뚜렷한 성능 향상을 달성한다.

ABSTRACT

Data cleansing is a typical approach used to improve the accuracy of machine learning models, which, however, requires extensive domain knowledge to identify the influential instances that affect the models. In this paper, we propose an algorithm that can identify influential instances without using any domain knowledge. The proposed algorithm automatically cleans the data, which does not require any of the users' knowledge. Hence, even non-experts can improve the models. The existing methods require the loss function to be convex and an optimal model to be obtained, which is not always the case in modern machine learning. To overcome these limitations, we propose a novel approach specifically designed for the models trained with stochastic gradient descent (SGD). The proposed method infers the influential instances by retracing the steps of the SGD while incorporating intermediate models computed in each step. Through experiments, we demonstrate that the proposed method can accurately infer the influential instances. Moreover, we used MNIST and CIFAR10 to show that the models can be effectively improved by removing the influential instances suggested by the proposed method.

연구 동기 및 목표

  • 기존의 데이터 정제 방법이 도메인 전문 지식이 필요로 하는 영향력 있는 훈련 인스턴스를 식별하는 데에 한계가 있다는 문제를 해결하기 위해.
  • 이전 방법들이 볼록 손실 함수와 최적의 모델 수렴을 가정하는 데 의존하는 문제를 해결하기 위해, 현대 딥러닝에서 자주 충족되지 않는 조건에서도 작동할 수 있도록 하기 위해.
  • 확률적 경사하강법(SGD)으로 훈련된 모델에 특화된 방법을 개발하기 위해.
  • 사용자 수동 조작이나 도메인 지식 없이도 비전문가가 자동화된 데이터 정제를 통해 모델 성능을 향상시킬 수 있도록 하기 위해.
  • 식별된 영향력 있는 인스턴스를 제거함으로써 표준 벤치마크에서 모델 정확도 향상 효과를 입증하기 위해.

제안 방법

  • 모든 훈련 단계를 거쳐 SGD 최적화 경로를 역행함으로써 영향력 있는 훈련 인스턴스를 추론한다.
  • 각 SGD 업데이트 단계에서 계산된 중간 모델을 활용하여 개별 훈련 인스턴스가 모델 행동에 미치는 영향을 평가한다.
  • 손실 함수가 볼록하거나 최종 모델이 최적일 필요가 없기 때문에, 실제 딥러닝 환경에 적용 가능하다.
  • 훈련 경로 동안 모델 업데이트에 기여한 정도를 기반으로 영향력 있는 인스턴스를 식별하며, 추적 기반의 영향력 추정 기법을 사용한다.
  • 사용자 정의 히وري스틱이나 도메인 특화 기준이 필요 없이 완전히 데이터 기반의 자동화된 방식으로 작동한다.
  • 영향력 있는 인스턴스를 식별한 후, 이를 제거하고 정제된 데이터셋으로 재훈련함으로써 모델 성능 향상을 평가한다.

실험 결과

연구 질문

  • RQ1SGD로 훈련된 모델에서 도메인 지식이나 볼록성 가정 없이도 영향력 있는 훈련 인스턴스를 식별할 수 있는가?
  • RQ2제안된 방법은 기존의 영향력 추정 기법에 비해 얼마나 정확하게 가장 영향력 있는 훈련 인스턴스를 추론할 수 있는가?
  • RQ3식별된 영향력 있는 인스턴스를 제거함으로써 표준 벤치마크에서 모델 일반화 및 정확도 향상에 어느 정도 기여하는가?
  • RQ4손실 함수가 비볼록이고 최종 모델이 최적일 수 없는 경우에도 이 방법이 실질적인 딥러닝 모델에 효과적으로 적용될 수 있는가?
  • RQ5제안된 방법이 비전문가가 자동화된 데이터 정제를 통해 모델 성능을 향상시킬 수 있도록 할 수 있는가?

주요 결과

  • 제안된 방법은 도메인 지식이나 볼록 손실 함수가 없이도 SGD로 훈련된 모델에서 영향력 있는 훈련 인스턴스를 성공적으로 식별한다.
  • 각 SGD 업데이트 단계에서 생성된 중간 모델을 활용함으로써 높은 정확도의 영향력 추정을 달성한다.
  • MNIST 데이터셋에서 제안된 방법으로 식별된 상위 영향력 있는 인스턴스를 제거하면 모델 테스트 정확도에 측정 가능한 향상이 발생한다.
  • CIFAR-10 데이터셋에서 제안된 정제 접근법을 적용하면 정제된 데이터로 재훈련한 후 테스트 오차가 뚜렷이 감소한다.
  • 비전문가가 자동화된 데이터 정제를 통해 모델 성능 향상을 이룰 수 있음을 보여주며, 실제 머신러닝 워크플로우에서의 실용성을 입증한다.
  • 비볼록 최적화 경로에 대해서도 강인하며 최적 모델 수렴을 요구하지 않기 때문에, 현대 딥러닝 응용 분야에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.