[论文解读] DC-BENCH: Dataset Condensation Benchmark
该论文提出了DC-BENCH,这是首个通过四种关键评估协议对数据集压缩方法进行标准化评估的基准:在多样化增强下的性能表现、在不同架构间的可迁移性、在不同压缩比率下的有效性,以及在神经架构搜索(NAS)中的实用性。该基准揭示,尽管如训练轨迹匹配(TM)和差异缩放增强(DSA)等方法在单模型训练中优于基线方法,但在NAS和更深模型中无法泛化,且在高阶压缩比率下性能显著下降,凸显了当前方法在实际应用和可迁移性方面存在的关键缺陷。
Dataset Condensation is a newly emerging technique aiming at learning a tiny dataset that captures the rich information encoded in the original dataset. As the size of datasets contemporary machine learning models rely on becomes increasingly large, condensation methods become a prominent direction for accelerating network training and reducing data storage. Despite numerous methods have been proposed in this rapidly growing field, evaluating and comparing different condensation methods is non-trivial and still remains an open issue. The quality of condensed dataset are often shadowed by many critical contributing factors to the end performance, such as data augmentation and model architectures. The lack of a systematic way to evaluate and compare condensation methods not only hinders our understanding of existing techniques, but also discourages practical usage of the synthesized datasets. This work provides the first large-scale standardized benchmark on Dataset Condensation. It consists of a suite of evaluations to comprehensively reflect the generability and effectiveness of condensation methods through the lens of their generated dataset. Leveraging this benchmark, we conduct a large-scale study of current condensation methods, and report many insightful findings that open up new possibilities for future development. The benchmark library, including evaluators, baseline methods, and generated datasets, is open-sourced to facilitate future research and application.
研究动机与目标
- 为解决数据集压缩方法缺乏系统化、标准化的评估协议的问题,该问题阻碍了公平比较和实际应用。
- 识别影响性能评估的关键因素,如数据增强、模型架构和压缩比率,以避免掩盖压缩算法的真实有效性。
- 评估压缩数据集在单模型训练之外的真实世界效用,特别是在大规模下游任务(如神经架构搜索,NAS)中的表现。
- 探索使用合成数据初始化策略(如K-Center选择)对收敛速度和最终性能的影响。
- 提供一个全面的开源基准库,包含可复现的评估、排行榜和精选数据集,以加速数据集压缩领域的未来研究。
提出的方法
- 设计一个多维基准,通过四个评估协议对压缩方法进行评估:(1) 不同数据增强下的性能表现,(2) 在多种神经网络架构上的可迁移性,(3) 不同压缩比率下的性能表现,(4) 在NAS任务中的性能表现。
- 实现一个标准化的评估流程,将压缩方法的性能与随机种子和训练协议等外部因素隔离,确保公平比较。
- 在评估套件中包含最先进的压缩方法(DC、DSA、DM、TM)和基线数据选择方法(随机、K-Center)。
- 引入一种基于K-Center的合成数据初始化策略,并与随机初始化和高斯初始化进行对比,以评估其对收敛速度和最终准确率的影响。
- 开发公开排行榜,并将整个基准库(包括评估器、基线实现和生成的数据集)开源,托管于 https://github.com/justincui03/dc_benchmark。
- 在CIFAR-10和CIFAR-100上开展大规模实证分析,采用多样化的训练协议和现代NAS基准,评估方法的泛化能力和可扩展性。
实验结果
研究问题
- RQ1不同数据集压缩方法在不同数据增强策略下的表现如何?增强是否显著改变其相对排名?
- RQ2压缩数据集在不同神经网络架构上的泛化能力如何?与K-Center等简单数据选择基线相比,其可迁移性如何?
- RQ3随着压缩比率的提高,性能如何下降?在何种压缩比率下,压缩方法的表现与随机选择几乎无差别?
- RQ4压缩数据集能否有效加速神经架构搜索(NAS)?它们是否能保持在完整数据集上训练的模型的真实性能排名?
- RQ5使用K-Center等数据选择方法初始化合成数据,是否相比随机或高斯初始化能提升收敛速度和最终准确率?
主要发现
- 训练轨迹匹配(TM)在所有评估协议中表现最佳,其次为差异缩放增强(DSA),但TM在大规模数据集或高阶压缩比率下不具备可扩展性。
- 评估期间使用数据增强显著提升了所有压缩方法的性能,表明增强是评估压缩数据集时的关键因素。
- 压缩方法在极低压缩比率下最为有效;在CIFAR-10上,当每类图像数超过400张后,性能迅速下降至接近随机基线水平。
- 尽管在单模型训练中表现优异,当前压缩方法在NAS任务中无法有效迁移——在更大规模的NAS基准上,除K-Center外,所有方法在压缩数据集和完整数据集上的性能相关性均为负值或接近零。
- 使用K-Center初始化合成数据可将所需计算预算减少约30%,并将平均最终准确率提升1.3%,表明初始化策略对收敛速度和性能有决定性影响。
- 该基准揭示,当前压缩方法无法保持真实的模型性能排名,因为从压缩数据集中发现的最佳架构在完整数据集上往往表现不佳,表明其在模型搜索中的实用性存在根本性局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。