Skip to main content
QUICK REVIEW

[논문 리뷰] Dataset Condensation with Gradient Matching

Bo Zhao, Konda Reddy Mopuri|arXiv (Cornell University)|2020. 06. 10.
Machine Learning and Data Classification참고 문헌 63인용 수 105
한 줄 요약

이 논문은 대형 실제 데이터셋과의 그래디언트 매칭으로 소규모 합성 데이터셋을 학습하고, 적은 샘플로도 다양한 아키텍처에서 성능을 유지하며 처음부터 학습이 가능하도록 한다.

ABSTRACT

As the state-of-the-art machine learning methods in many fields rely on larger datasets, storing datasets and training models on them become significantly more expensive. This paper proposes a training set synthesis technique for data-efficient learning, called Dataset Condensation, that learns to condense large dataset into a small set of informative synthetic samples for training deep neural networks from scratch. We formulate this goal as a gradient matching problem between the gradients of deep neural network weights that are trained on the original and our synthetic data. We rigorously evaluate its performance in several computer vision benchmarks and demonstrate that it significantly outperforms the state-of-the-art methods. Finally we explore the use of our method in continual learning and neural architecture search and report promising gains when limited memory and computations are available.

연구 동기 및 목표

  • 대용량 데이터셋을 작고 정보-rich한 합성 세트로 응축해 데이터 효율적 학습을 가능하게 한다.
  • 실제 데이터와 합성 데이터의 학습 손실 간의 그래디언트 매칭으로 데이터 Condensation을 형식화한다.
  • 현대 딥 네트에서 확장 가능한 최적화를 가능하게 하는 커리큘럼 그래디언트 매칭 접근법을 개발한다.
  • 응축 데이터가 다양한 아키텍처 간 일반화 성능을 유지하며 처음부터 학습될 수 있음을 보여준다.

제안 방법

  • 합성 샘플 S와 라벨로 이루어진 축약 세트를 정의하여 신경망을 학습시킨다.
  • 네트워크 매개변수에 대한 L^S와 L^T의 그래디언트 간의 그래디언트 매칭 목표 D(·,·)를 형식화한다.
  • 비싼 unrolling을 피하기 위해 최적화 단계 추적을 포함하는 커리큘럼 그래디언트 매칭 전략을 사용한다.
  • 고정 스텝 내부 루프를 가진 백 최적화를 적용하여 각 층 간의 그래디언트 거리를 최소화하며 S를 업데이트한다.
  • S에서 학습한 네트워크를 통해 전체 데이터셋에서의 학습을 근사하고, 아키텍처 간 일반화를 가능하게 한다.
  • 그래디언트 매칭 거리를 계층별 용어로 분해하고 FC 및 Conv 계층에 대해 출력 노드당 그룹화를 적용한다(Eq. 10).

실험 결과

연구 질문

  • RQ1대규모 이미지 데이터셋을 소형 합성 세트로 압축해도 다운스트림 성능의 큰 손실 없이 보존될 수 있는가?
  • RQ2합성 세트로 학습된 네트워크가 실제 이미지에 일반화되고 서로 다른 아키텍처 간에 일반화될 수 있는가?
  • RQ3단일 축약 세트가 여러 네트워크 아키텍처 학습에 효과적일 수 있는가?
  • RQ4그래디언트 매칭이 데이터 Condensation의 내부 루프 unrolling에 비해 확장 가능하고 메모리 효율적인 대안이 될 수 있는가?

주요 결과

  • 압축된 세트는 MNIST, FashionMNIST, SVHN, CIFAR-10에서 여러 아키텍처에 대해 Random, Herding, K-Center, Forgetting 및 DD 대비 우수한 성능을 보인다.
  • MNIST에서 클래스당 50장의 이미지로 구성된 경우, 방법은 전체 데이터셋 상한의 99.6%에 근접(전체 데이터셋 상한 99.6%, 클래스당 50장일 때 98.8% 주의)한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.