Skip to main content
QUICK REVIEW

[論文レビュー] DREAM: Efficient Dataset Distillation by Representative Matching

Yanqing Liu, Jianyang Gu|arXiv (Cornell University)|Feb 28, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

DREAMは、勾配または埋め込みマッチングに使用する元の画像を、クラスタリングによって特定された代表的画像に限定することで、効率的なデータセット蒸留を実現する代表的マッチング戦略を提案する。これにより、性能に損なわれることなく8倍以上のトレーニングイテレーションを削減できる。ランダムサンプリングによるノイズの多い境界サンプルを避けることで、最適化の安定性と一般化性能が向上する。

ABSTRACT

Dataset distillation aims to synthesize small datasets with little information loss from original large-scale ones for reducing storage and training costs. Recent state-of-the-art methods mainly constrain the sample synthesis process by matching synthetic images and the original ones regarding gradients, embedding distributions, or training trajectories. Although there are various matching objectives, currently the strategy for selecting original images is limited to naive random sampling. We argue that random sampling overlooks the evenness of the selected sample distribution, which may result in noisy or biased matching targets. Besides, the sample diversity is also not constrained by random sampling. These factors together lead to optimization instability in the distilling process and degrade the training efficiency. Accordingly, we propose a novel matching strategy named as extbf{D}ataset distillation by extbf{RE}present extbf{A}tive extbf{M}atching (DREAM), where only representative original images are selected for matching. DREAM is able to be easily plugged into popular dataset distillation frameworks and reduce the distilling iterations by more than 8 times without performance drop. Given sufficient training time, DREAM further provides significant improvements and achieves state-of-the-art performances.

研究の動機と目的

  • ランダムサンプリングによる元の画像の選択が最適化ベースのデータセット蒸留における非効率性と不安定性を引き起こす問題に対処すること。
  • 最適化に偏りをもたらす高勾配・境界サンプルへの依存を減らすことで、トレーニングの安定性を向上させること。
  • 蒸留中のマッチングターゲットの分布における多様性と均等性を向上させること。
  • 蒸留データセット生成における収束速度の向上と最終的な性能の向上を実現すること。
  • 既存のデータセット蒸留フレームワークと互換性がある、即挿入可能な戦略を提供すること。

提案手法

  • 各クラス内でクラスタリングを適用し、元のデータ分布を反映するサブクラスタを特定すること。
  • クラスタ中心をマッチング用の代表的サンプルとして選択し、クラス分布の均等なカバーを保証すること。
  • 同じクラスタリングに基づく戦略を用いて、クラスタ中心から合成画像を初期化することで収束を加速すること。
  • 既存の蒸留フレームワークにおける元の画像のランダムサンプリングを、代表的画像マッチングに置き換えること。
  • 最適化ベースの蒸留における勾配、埋め込み、またはトラジェクトリーマッチングの目的関数と互換性を維持すること。
  • DeepInversionなど、他の最適化ベースの蒸留手法に対しても、代表的マッチング戦略を統合すること。

実験結果

リサーチクエスチョン

  • RQ1データセット蒸留におけるランダムサンプリングは、マッチングターゲットの不均一な分布によって最適化の不安定性を引き起こすか?
  • RQ2クラスタリングによる代表的サンプルの選択は、データセット蒸留におけるトレーニング効率と安定性を向上させられるか?
  • RQ3代表的マッチングは、性能を損なわせることなく、何らかの程度まで蒸留イテレーション数を削減できるか?
  • RQ4代表的マッチングは、蒸留された合成画像の多様性と品質にどのような影響を与えるか?
  • RQ5提案手法は、異なる蒸留フレームワークや継続的学習のシナリオにおいても汎用性を示せるか?

主な発見

  • DREAMは、ランダムサンプリングと比較して、蒸留イテレーション数を8倍以上削減しながら、同等の性能を達成する。
  • 十分なトレーニング時間を確保した場合、CIFAR-10およびCIFAR-100で最先端の性能を達成し、先行手法を上回る。
  • DREAMにおける最終的な蒸留画像の分布は、特徴空間全体に均等に広がっており、分布の端に集積するのを回避している。
  • 可視化結果から、DREAMが生成する画像は、ランダムサンプリングのベースラインと比較して、はっきりとしたカテゴリ特性と高い多様性を示している。
  • 継続的学習の文脈でも、DREAMはベースラインに対して一貫した性能優位性を維持しており、学習対象のクラス数が増えるにつれて差が広がる。
  • 本手法は、既存の蒸留フレームワークへの即挿入が容易であり、複数のベンチマークや設定において一貫して性能を向上させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。