[論文レビュー] Selectivity Drives Productivity: Efficient Dataset Pruning for Enhanced Transfer Learning
本稿では、転移学習向けに2つの新規データセット pruning 法——ラベルマッピング(LM)と特徴マッピング(FM)——を提案する。これにより、性能に損なわれることなく、ソースデータセットを最大80%まで削減可能である。ソース・ターゲットドメインの整合性を活用することで、2〜5倍の高速化が達成され、多様なタスクやモデルにおいて下流の精度を維持する。
Massive data is often considered essential for deep learning applications, but it also incurs significant computational and infrastructural costs. Therefore, dataset pruning (DP) has emerged as an effective way to improve data efficiency by identifying and removing redundant training samples without sacrificing performance. In this work, we aim to address the problem of DP for transfer learning, i.e., how to prune a source dataset for improved pretraining efficiency and lossless finetuning accuracy on downstream target tasks. To our best knowledge, the problem of DP for transfer learning remains open, as previous studies have primarily addressed DP and transfer learning as separate problems. By contrast, we establish a unified viewpoint to integrate DP with transfer learning and find that existing DP methods are not suitable for the transfer learning paradigm. We then propose two new DP methods, label mapping and feature mapping, for supervised and self-supervised pretraining settings respectively, by revisiting the DP problem through the lens of source-target domain mapping. Furthermore, we demonstrate the effectiveness of our approach on numerous transfer learning tasks. We show that source data classes can be pruned by up to 40% ~ 80% without sacrificing downstream performance, resulting in a significant 2 ~ 5 times speed-up during the pretraining stage. Besides, our proposal exhibits broad applicability and can improve other computationally intensive transfer learning techniques, such as adversarial pretraining. Codes are available at https://github.com/OPTML-Group/DP4TL.
研究の動機と目的
- 転移学習におけるデータセットpruningのギャップに取り組むこと。既存のドメイン内手法は、間接的なソース・ターゲット影響のため失敗する。
- 転移学習に特化した効率的で低オーバーヘッドのpruning手法を開発すること。これは教師ありおよび自己教師ありの事前学習を含む。
- 下流の微調整精度を維持または向上させつつ、顕著な事前学習の高速化を実現すること。
- ソース・ターゲットドメインマッピングを通じて、データセットpruningと転移学習を統一的な枠組みで結びつけること。
- 敵対的事前学習を含む、多様なアーキテクチャ、データセット、事前学習パラダイムに広く適用可能であることを示すこと。
提案手法
- ラベルマッピング(LM)は、小さなサロゲートモデルを用いて、ターゲットクラスとの意味的および特徴レベルの整合性に基づき、ソースクラスを選択する。
- 特徴マッピング(FM)は、自己教師あり事前学習に対応するため、ソースとターゲットドメイン間の特徴表現を照合することで、アプローチを拡張する。
- 両手法とも、最終バックボーンモデルに依存しない小規模で高速なサロゲートモデル(例:ResNet-18)を用い、完全なモデル再学習を回避して、ソースクラスの下流性能への影響を推定する。
- pruningプロセスは、ソースクラスのターゲットタスクへの関連性に基づいて順位付けするスコア関数によってガイドされ、計算コストを最小限に抑える。
- フレームワークは、最終的なバックボーンモデルに依存しないように設計されており、異なるアーキテクチャや事前学習目的への再利用を可能にする。
- 損失関数の平坦性は、εシャープネスやヘッセ行列ノルムなどの指標を用いて分析され、prunedデータからの一般化性能の向上を検証する。

実験結果
リサーチクエスチョン
- RQ1ソースとターゲットドメインが異なる転移学習の文脈において、データセットpruningを効果的に拡張できるか?
- RQ2なぜ従来のドメイン内データセットpruning手法は、転移学習環境では失敗するのか?
- RQ3転移学習向けに、低複雑性かつスケーラブルな手法を設計し、有害または冗長なソースデータクラスを特定・削除できるか?
- RQ4多様なタスクやモデルにおいて、下流性能が劣化しない範囲で、ソースデータをどの程度までpruningできるか?
- RQ5ソース・ターゲットドメインの整合性に基づくpruningが、下流タスクにおける一般化性能および損失関数の平坦性にどのように影響するか?
主な発見
- 提案されたラベルマッピング(LM)および特徴マッピング(FM)手法は、OxfordPets や StanfordCars といった下流タスクにおいて、ImageNetのデータセットを最大80%まで削減しても性能に損なわれない。
- ResNet-101 などの大規模モデルにおいて、2〜5倍の事前学習の高速化が達成され、複数のベンチマークで下流精度に損なわれない。
- 40%のpruning比において、LMはほとんどの転移学習タスク(少数ショット設定を含む)で「勝利のサブセット」を的確に特定する。
- prunedされたソースデータセットは、εシャープネス、ヘッセ行列ノルム、Fisher-Raoノルムで測定されたように、下流タスクでより平坦な損失関数の形状を示し、一般化性能の向上を示している。
- t-SNEを用いた特徴可視化により、保持されたソースクラスがターゲットクラスに意味的および空間的に近いのに対し、prunedされたクラスは分散しており遠く離れていることが確認された。
- 本手法は高い汎用性を示す:VGG や ResNet-32 などの異なるサロゲートモデルを用いても、80%のpruningにおいて、デフォルトのResNet-18ベースラインと97.7%までの高い一致度を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。