Skip to main content
QUICK REVIEW

[논문 리뷰] Dataset Condensation with Distribution Matching

Bo Zhao, Hakan Bilen|arXiv (Cornell University)|2021. 10. 08.
Domain Adaptation and Few-Shot Learning참고 문헌 33인용 수 14
한 줄 요약

이 논문은 최대 평균 이격도(MMD)를 사용하여 다수의 무작위로 샘플링된 임bedding 공간에서 실제 데이터와 합성 데이터 간의 특징 분포를 매칭함으로써 고품질의 훈련 이미지를 합성하는 빠르고 효율적인 데이터셋 압축 방법을 제안한다. 기존 방법들과 달리, 고비용의 이중 최적화와 두 번째 순서 미분을 피함으로써 CIFAR-10에서 45배 빠른 합성 속도를 달성하면서도 연속 학습 및 신경망 아키텍처 탐색에서 최신 기술 수준의 성능을 유지하거나 초월한다.

ABSTRACT

Computational cost of training state-of-the-art deep models in many learning problems is rapidly increasing due to more sophisticated models and larger datasets. A recent promising direction for reducing training cost is dataset condensation that aims to replace the original large training set with a significantly smaller learned synthetic set while preserving the original information. While training deep models on the small set of condensed images can be extremely fast, their synthesis remains computationally expensive due to the complex bi-level optimization and second-order derivative computation. In this work, we propose a simple yet effective method that synthesizes condensed images by matching feature distributions of the synthetic and original training images in many sampled embedding spaces. Our method significantly reduces the synthesis cost while achieving comparable or better performance. Thanks to its efficiency, we apply our method to more realistic and larger datasets with sophisticated neural architectures and obtain a significant performance boost. We also show promising practical benefits of our method in continual learning and neural architecture search.

연구 동기 및 목표

  • 대규모 실제 데이터셋에 의존하지 않고, 소규모이면서도 정보가 풍부한 훈련 세트를 합성함으로써 딥 모델 훈련의 계산 비용을 줄이는 것.
  • 코어셋 선택 기법의 한계를 극복하기 위해, 원본 샘플에 포함된 정보에 제한되고 탐색 전략이 타협된 탐욕적 접근 방식을 피하는 것.
  • 데이터셋 압축 과정에서 고비용의 이중 최적화와 두 번째 순서 미분 계산이 필요 없도록 하여 확장성과 효율성을 향상시키는 것.
  • 각 클래스별로 독립적이고 병렬적으로 합성 데이터를 훈련시킬 수 있도록 하여 더 큰 복잡한 데이터셋에 대한 확장성을 확보하는 것.
  • 연속 학습 및 신경망 아키텍처 탐색에서 효율적인 실용성을 입증하기 위해, 합성된 세트를 프록시 데이터셋으로 사용하는 것.

제안 방법

  • 이 방법은 무작위로 초기화된 딥 네트워크 임베딩 공간의 집합에서 실제 데이터와 합성 데이터 간의 분포 매칭 문제로 데이터셋 압축을 공식화한다.
  • 실제 및 합성 특징 임베딩 간의 분포 차이를 측정하고 최소화하기 위해 최대 평균 이격도(MMD)를 사용한다. 이는 다수의 샘플링된 임베딩 공간에서 수행된다.
  • 합성 이미지는 이중 최적화와 두 번째 순서 도함수를 피하기 위해, 합성 이미지에 대한 MMD 손실의 일阶 미분만을 사용하여 종단 간 최적화된다.
  • 이 방법은 각 클래스별로 합성 데이터를 독립적이고 병렬적으로 최적화할 수 있도록 하여 훈련 효율성과 확장성을 크게 향상시킨다.
  • 임베딩 공간은 무작위로 초기화된 딥 네트워크를 샘플링하여 효율적으로 생성되며, 최적화 과정에서 고정되어 보정되지 않는다.

실험 결과

연구 질문

  • RQ1이중 최적화나 두 번째 순서 도함수 없이도, 무작위 임베딩 공간에서의 분포 매칭이 경쟁력 있는 데이터셋 압축 성능을 달성할 수 있는가?
  • RQ2기본 벤치마크에서 제안된 방법이 최신 기술 대비 합성 속도와 일반화 성능 측면에서 어떻게 비교되는가?
  • RQ3압축된 합성 세트가 전체 데이터셋 성능과 높은 상관관계를 유지하면서 신경망 아키텍처 탐색을 가속화하는 데 효과적인 프록시 데이터셋으로 기능할 수 있는가?
  • RQ4연속 학습 환경에서 다양한 데이터 분할 전략에 대해 이 방법이 강건한 성능을 유지하는가?
  • RQ5TinyImageNet 및 ImageNet-1K과 같은 더 큰 복잡한 데이터셋에 대해 이 방법이 효과적으로 확장 가능한가?

주요 결과

  • CIFAR-10에서 500개의 합성 이미지를 생성할 때, 제안된 방법은 최신 기술 대비 45배 빠른 합성 시간을 기록했으며, 성능는 유사하거나 향상된 결과를 보였다.
  • 5개 및 10개 클래스 학습 단계를 가진 연속 학습에서, 이 방법(GDumb + DM)은 각각 34.4% 및 34.6%의 정확도를 달성하여 DSA(31.7% 및 30.5%), 허딩(28.2% 및 27.4%), 무작위(모두 24.8%)를 능가했다.
  • CIFAR-10에서의 신경망 아키텍처 탐색에서, 프록시 세트와 전체 데이터셋 성능 간 스피어만 순위 상관계수는 0.76를 기록했으며, DSA(0.68)를 상회하고 무작위(-0.04)는 오히려 뒤지며, 훈련 데이터의 1%만을 사용함에도 불구하고 뛰어난 성능을 보였다.
  • 프록시 세트에서 검증 정확도는 84.3%에 도달했으며, 훈련 시간은 단 72분이었는데, 이는 전체 데이터셋 훈련에 필요한 3580.2분에 비해 무시할 만큼 적었다.
  • 이 방법은 더 큰 데이터셋으로도 성공적으로 확장되었으며, CIFAR-10에서 각 클래스당 1250개의 합성 이미지를 학습했고, TinyImageNet 및 ImageNet-1K에서도 실행 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.