[논문 리뷰] DiM: Distilling Dataset into Generative Model
이 논문은 대규모 훈련 데이터셋의 지식을 합성 이미지가 아닌 조건부 생성 모델에 통합하는 새로운 데이터 정련 프레임워크인 DiM을 제안한다. 모델 풀을 활용해 실재 이미지와 생성 이미지 간의 로짓 차이를 최소화함으로써, 실시간 샘플 생성을 가능하게 하여 다양한 아키텍처와 정련 비율에서 최신 기술 수준의 성능을 달성하며, 이전 방법들에 비해 재배포 비용을 13×–160× 낮춘다.
Dataset distillation reduces the network training cost by synthesizing small and informative datasets from large-scale ones. Despite the success of the recent dataset distillation algorithms, three drawbacks still limit their wider application: i). the synthetic images perform poorly on large architectures; ii). they need to be re-optimized when the distillation ratio changes; iii). the limited diversity restricts the performance when the distillation ratio is large. In this paper, we propose a novel distillation scheme to extbf{D}istill information of large train sets extbf{i}nto generative extbf{M}odels, named DiM. Specifically, DiM learns to use a generative model to store the information of the target dataset. During the distillation phase, we minimize the differences in logits predicted by a models pool between real and generated images. At the deployment stage, the generative model synthesizes various training samples from random noises on the fly. Due to the simple yet effective designs, the trained DiM can be directly applied to different distillation ratios and large architectures without extra cost. We validate the proposed DiM across 4 datasets and achieve state-of-the-art results on all of them. To the best of our knowledge, we are the first to achieve higher accuracy on complex architectures than simple ones, such as 75.1\% with ResNet-18 and 72.6\% with ConvNet-3 on ten images per class of CIFAR-10. Besides, DiM outperforms previous methods with 10\% $\sim$ 22\% when images per class are 1 and 10 on the SVHN dataset.
연구 동기 및 목표
- ResNet 및 DenseNet과 같은 대규모 아키텍처에 대해 기존 데이터 정련 방법의 낮은 확장성 문제를 해결한다.
- 이전 방법에서 새로운 정련 비율(예: 클래스당 이미지 수)을 적용할 때마다 재학습이 필요한 비효율성을 해결한다.
- 생성 모델을 활용해 고정밀도 정련 데이터의 다양성과 성능을 향상시켜, 특히 높은 정련 비율에서 성능을 개선한다.
- 재학습 없이도 다양한 아키텍처와 정련 비율에 대해 재사용 가능한 단일 모델을 제공한다.
- 고정된 합성 이미지가 아닌 생성 모델에 지식을 저장함으로써 아키텍처 간 일반화 능력을 향상시킨다.
제안 방법
- 랜덤 노이즈에서 훈련 이미지를 생성하는 조건부 생성 모델을 훈련시키며, 다양한 지도를 제공하기 위해 모델 풀을 활용한다.
- 각 훈련 에포크에서 풀에서 무작위로 선택한 모델을 사용해 실재 이미지와 생성 이미지의 예측 로짓 간의 L2 차이를 최소화한다.
- 모든 정련 비율과 아키텍처에 대해 고정된 생성 모델을 사용함으로써, IPC나 모델 아키텍처를 변경할 때 재학습이 필요 없도록 한다.
- DiI 방법과의 공정한 비교를 위해 평가 지표로 클래스당 이미지 수(INPC)를 정의한다.
- C-3, R-10, R-18 등 다양한 모델 풀을 활용해 정련 기간 동안 다층적 지도를 제공한다.
- 배포 시 실시간으로 훈련 샘플을 생성하며, 계산 오버헤드가 극히 낮다(배치당 2–80ms).
실험 결과
연구 질문
- RQ1생성 모델이 합성 이미지보다 대규모 데이터셋의 분류 지식을 더 효율적으로 저장하고 재현할 수 있는가?
- RQ2지식을 모델(DiM)에 정련하는 것이 지식을 이미지(DiI)에 정련하는 것보다 대규모 아키텍처에서 성능을 향상시키는가?
- RQ3DiM은 재학습 없이 다양한 정련 비율과 모델 아키텍처에서 재사용 가능한가?
- RQ4DiM의 성능은 하류 분류 작업에서 GAN 기반 데이터 합성과 비교해 어떻게 되는가?
- RQ5DiM에서 실시간 이미지 생성의 계산 비용은 표준 훈련에 비해 얼마나 되는가?
주요 결과
- ResNet-18를 사용해 CIFAR-10에서 클래스당 10장의 이미지로 75.1%의 정확도를 달성했으며, 동일 조건에서 ConvNet-3(72.6%)보다 뛰어난 성능을 보여, 더 큰 아키텍처로의 확장성 향상을 입증했다.
- SVHN에서 클래스당 1장과 10장의 이미지로 각각 10%–22%의 정확도 향상을 기록했으며, 이는 이전 방법보다 뛰어난 성능을 의미한다.
- MTT 및 IDC와 같은 최신 기술 수준의 DiI 방법에 비해 재배포 GPU 시간을 13×에서 160×까지 감소시켰다.
- INPC = 50일 때, CIFAR-10에서 ConvNet-3와 ResNet-18을 사용해 각각 72.6%와 74.1%의 정확도를 달성했으며, GAN 기반 기준선보다 최대 5% 높은 성능을 보였다.
- DiM에서 이미지 생성의 계산 비용은 극히 낮다—배치당 2–80ms이며, 총 훈련 시간의 2%에서 20%에 불과하여 실질적으로 무시할 수 있다.
- DiM는 강력한 아키텍처 간 일반화 능력을 보였으며, INPC가 높을수록 성능이 향상되고, DenseNet-121 및 ResNet-50와 같은 복잡한 모델로도 효과적으로 확장된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.