Skip to main content
QUICK REVIEW

[논문 리뷰] DREAM: Efficient Dataset Distillation by Representative Matching

Yanqing Liu, Jianyang Gu|arXiv (Cornell University)|2023. 02. 28.
Advanced Neural Network Applications인용 수 6
한 줄 요약

DREAM은 최적화 기반 데이터셋 정련에서 랜덤 샘플링으로 인한 비효율성과 안정성 문제를 해결하기 위해, 군집화를 통해 식별된 대표적인 원본 이미지만을 선택하여 기울기 또는 임bedding 매칭을 수행하는 대표성 매칭 전략을 제안한다. 이로 인해 성능 저하 없이 학습 반복 횟수를 8배 이상 감소시켰으며, 랜덤 샘플링에서 유도되는 노이즈가 많고 경계에 위치한 샘플을 피하므로 최적화 안정성과 일반화 성능을 향상시킨다.

ABSTRACT

Dataset distillation aims to synthesize small datasets with little information loss from original large-scale ones for reducing storage and training costs. Recent state-of-the-art methods mainly constrain the sample synthesis process by matching synthetic images and the original ones regarding gradients, embedding distributions, or training trajectories. Although there are various matching objectives, currently the strategy for selecting original images is limited to naive random sampling. We argue that random sampling overlooks the evenness of the selected sample distribution, which may result in noisy or biased matching targets. Besides, the sample diversity is also not constrained by random sampling. These factors together lead to optimization instability in the distilling process and degrade the training efficiency. Accordingly, we propose a novel matching strategy named as extbf{D}ataset distillation by extbf{RE}present extbf{A}tive extbf{M}atching (DREAM), where only representative original images are selected for matching. DREAM is able to be easily plugged into popular dataset distillation frameworks and reduce the distilling iterations by more than 8 times without performance drop. Given sufficient training time, DREAM further provides significant improvements and achieves state-of-the-art performances.

연구 동기 및 목표

  • 원본 이미지의 랜덤 샘플링으로 인한 최적화 기반 데이터셋 정련의 비효율성과 불안정성 문제를 해결하기 위해.
  • 최적화에 편향을 주는 고기울기 경계 샘플에 대한 의존도를 줄임으로써 학습 안정성을 향상시키기 위해.
  • 정련 과정 중 매칭 타깃의 분포에서 다양성과 균형을 향상시키기 위해.
  • 정련된 데이터셋 생성에서 더 빠른 수렴과 더 나은 최종 성능을 달성하기 위해.
  • 기존 데이터셋 정련 프레임워크와 호환되는 즉시 사용 가능한 전략을 제공하기 위해.

제안 방법

  • 각 클래스 내에서 군집화를 적용하여 데이터 분포를 반영하는 부분 군집을 식별한다.
  • 군집 중심을 매칭을 위한 대표 샘플로 선택하여 클래스 분포의 균형 임의의 커버리지 보장한다.
  • 동일한 군집 기반 전략을 활용해 군집 중심에서부터 합성 이미지를 초기화함으로써 수렴 속도를 가속화한다.
  • 기존 정련 프레임워크에서 원본 이미지의 랜덤 샘플링을 대체로 대표 이미지 매칭을 적용한다.
  • 최적화 기반 정련에서 기울기, 임베딩 또는 궤적 매칭 목표와의 호환성을 유지한다.
  • DeepInversion 등 기존 최적화 기반 정련 방법과 같은 프레임워크에 대표성 매칭 전략을 통합한다.

실험 결과

연구 질문

  • RQ1데이터셋 정련에서 랜덤 샘플링은 매칭 타깃의 분포가 불균형해지면서 최적화의 불안정성을 유도하는가?
  • RQ2군집화를 통해 대표 샘플을 선택하면 데이터셋 정련의 효율성과 안정성이 향상되는가?
  • RQ3대표성 매칭은 성능 저하 없이 얼마나 많은 정련 반복 횟수를 줄일 수 있는가?
  • RQ4대표성 매칭은 정련된 합성 이미지의 다양성과 품질에 어떤 영향을 미치는가?
  • RQ5제안된 전략은 다양한 정련 프레임워크와 지속적 학습 시나리오에 일반화 가능한가?

주요 결과

  • DREAM은 랜덤 샘플링 대비 정련 반복 횟수를 8배 이상 감소시키며, 성능 저하 없이 훨씬 적은 단계로 유사한 성능를 달성한다.
  • 충분한 학습 시간이 확보된 경우, DREAM은 CIFAR-10 및 CIFAR-100에서 기존 방법을 뛰어넘는 최고 수준의 성능를 기록한다.
  • DREAM 하에서 최종 정련된 이미지 분포는 특징 공간 전반에 걸쳐 균일하게 분포되어 있으며, 분포 경계에 집중되는 것을 방지한다.
  • 시각화 결과에 따르면, DREAM이 생성한 이미지는 랜덤 샘플링 기반 베이스라인 대비 더 명확한 분류적 특징과 더 높은 다양성을 보인다.
  • 지속적 학습 환경에서 DREAM은 기존 베이스라인 대비 일관된 성능 우위를 유지하며, 학습 대상 클래스가 많아질수록 격차가 커진다.
  • 이 방법은 기존 정련 프레임워크에 쉽게 통합 가능하며, 다양한 벤치마크와 설정에서 일관되게 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.