Skip to main content
QUICK REVIEW

[論文レビュー] DiM: Distilling Dataset into Generative Model

Kai Wang, Jianyang Gu|arXiv (Cornell University)|Mar 8, 2023
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

この論文では、合成画像ではなく、大規模なトレーニングデータセットからの知識を条件付き生成モデルに凝縮する、新しいデータセット凝縮フレームワークであるDiMを提案する。モデルプールを用いて、実画像と生成画像のログット差を最小化することで、リアルタイムでのサンプル生成を可能にし、アーキテクチャや凝縮比に関わらず最先端の性能を達成した。従来手法と比較して再デプロイコストが13×~160×低減された。

ABSTRACT

Dataset distillation reduces the network training cost by synthesizing small and informative datasets from large-scale ones. Despite the success of the recent dataset distillation algorithms, three drawbacks still limit their wider application: i). the synthetic images perform poorly on large architectures; ii). they need to be re-optimized when the distillation ratio changes; iii). the limited diversity restricts the performance when the distillation ratio is large. In this paper, we propose a novel distillation scheme to extbf{D}istill information of large train sets extbf{i}nto generative extbf{M}odels, named DiM. Specifically, DiM learns to use a generative model to store the information of the target dataset. During the distillation phase, we minimize the differences in logits predicted by a models pool between real and generated images. At the deployment stage, the generative model synthesizes various training samples from random noises on the fly. Due to the simple yet effective designs, the trained DiM can be directly applied to different distillation ratios and large architectures without extra cost. We validate the proposed DiM across 4 datasets and achieve state-of-the-art results on all of them. To the best of our knowledge, we are the first to achieve higher accuracy on complex architectures than simple ones, such as 75.1\% with ResNet-18 and 72.6\% with ConvNet-3 on ten images per class of CIFAR-10. Besides, DiM outperforms previous methods with 10\% $\sim$ 22\% when images per class are 1 and 10 on the SVHN dataset.

研究の動機と目的

  • ResNet や DenseNet などの大規模アーキテクチャへの既存のデータセット凝縮手法のスケーラビリティの低さを解決すること。
  • 従来手法では、各新しい凝縮比(例:クラスあたりの画像数)に対して再トレーニングが必要で非効率であった問題を克服すること。
  • 生成モデルを活用することで、特に高凝縮比において、凝縮データの多様性と性能を向上させること。
  • 再トレーニングが不要な、一度のトレーニングで複数のアーキテクチャや凝縮比に適用可能な、再利用可能なモデルを提供すること。
  • 固定された合成画像ではなく、生成モデルに知識を格納することで、アーキテクチャ間の一般化性能を向上させること。

提案手法

  • ランダムノイズからトレーニング画像を合成する条件付き生成モデルを訓練し、多様な指導を提供するモデルプールを活用する。
  • 各トレーニングエポックにおいて、プールからランダムに選択されたモデルを用いて、実画像と生成画像の予測ログットのL2差を最小化する。
  • すべての凝縮比やアーキテクチャに固定された生成モデルを用いることで、IPC やモデルアーキテクチャを変更しても再トレーニングの必要がなくなる。
  • DiI手法との公平な比較のため、Image Numbers of Per Class (INPC) を評価指標として定義する。
  • C-3, R-10, R-18 など多様なモデルプールを活用し、凝縮中にマルチレベルの指導を提供する。
  • デプロイ時にリアルタイムでトレーニングサンプルを生成し、計算オーバーヘッドは極めて小さい(バッチあたり2~80ms)。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、合成画像よりも、大規模データセットからの識別的知識をより効率的に格納・再現できるか?
  • RQ2DiM がモデルに知識を凝縮するのに対し、DiI が画像に知識を凝縮するのと比較して、大規模アーキテクチャでの性能が向上するか?
  • RQ3DiM は再トレーニングなしに、さまざまな凝縮比やモデルアーキテクチャで再利用可能か?
  • RQ4DiM の性能は、GANベースのデータ合成と比較して、下流の分類タスクで優れているか?
  • RQ5DiM におけるリアルタイム画像生成の計算コストは、標準的なトレーニングと比較してどの程度か?

主な発見

  • ResNet-18 を用いて、CIFAR-10 でクラスあたり10枚の画像を使用した場合、DiM は75.1%の精度を達成し、同じ設定で72.6%を記録した ConvNet-3 よりも優れた性能を示し、大規模アーキテクチャへのスケーラビリティの優位性を実証した。
  • SVHN では、1枚および10枚の画像毎クラスの設定で、従来手法と比較して10%~22%の精度向上を達成した。
  • MTT や IDC といった最先端の DiI 手法と比較して、DiM は再デプロイのGPU時間を13×~160×まで削減した。
  • INPC = 50 の場合、CIFAR-10 で ConvNet-3 と ResNet-18 を用いてそれぞれ72.6%および74.1%の精度を達成し、GANベースのベースラインを最大5%上回った。
  • DiM における画像生成の計算コストは極めて低く、バッチあたり2~80msで、合計トレーニング時間の2%~20%にとどまり、実用上無視できる。
  • DiM は強力なアーキテクチャ間一般化性能を示しており、INPC が高くなるほど性能が向上し、DenseNet-121 や ResNet-50 といった複雑なモデルに対しても効果的にスケーリングされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。