[论文解读] Dataset Distillation with Convexified Implicit Gradients
该论文提出RCIG,一种新型的数据集蒸馏算法,通过利用重参数化的凸化隐式梯度,实现了最先进性能。通过使用固定宽度的有限神经正切核(NTK)对内层优化进行凸化,并通过解析参数化减少偏差,RCIG在每类仅使用一张图像的情况下,于ImageNet上实现了比之前最先进方法高出108%的准确率。
We propose a new dataset distillation algorithm using reparameterization and convexification of implicit gradients (RCIG), that substantially improves the state-of-the-art. To this end, we first formulate dataset distillation as a bi-level optimization problem. Then, we show how implicit gradients can be effectively used to compute meta-gradient updates. We further equip the algorithm with a convexified approximation that corresponds to learning on top of a frozen finite-width neural tangent kernel. Finally, we improve bias in implicit gradients by parameterizing the neural network to enable analytical computation of final-layer parameters given the body parameters. RCIG establishes the new state-of-the-art on a diverse series of dataset distillation tasks. Notably, with one image per class, on resized ImageNet, RCIG sees on average a 108\% improvement over the previous state-of-the-art distillation algorithm. Similarly, we observed a 66\% gain over SOTA on Tiny-ImageNet and 37\% on CIFAR-100.
研究动机与目标
- 解决在每类数据极少的情况下实现更高性能的数据集蒸馏挑战。
- 克服现有基于隐式梯度的方法所面临的非凸性与梯度估计偏差过高的局限性。
- 开发一种可扩展且准确的蒸馏算法,使其在包括ImageNet、Tiny-ImageNet和CIFAR-100在内的多种基准上均具有良好的泛化能力。
- 通过将蒸馏作为防御机制,提升对成员推断攻击的鲁棒性。
提出的方法
- 将数据集蒸馏建模为一个双层优化问题,其中模型权重为内层参数,蒸馏数据为外层参数。
- 应用隐函数定理,通过反向传播内层优化循环计算元梯度。
- 通过使用固定宽度的有限神经正切核(NTK)近似内层优化,实现凸化,将非凸问题转化为凸问题。
- 对神经网络进行重参数化,以实现从主干参数到最终层参数的解析计算,从而减少隐式梯度估计中的偏差。
- 采用混合方法优化蒸馏数据,结合隐式梯度与线性化训练,以提升稳定性和收敛性。
- 通过子采样反向传播实现高效扩展,在保持低内存占用的同时适用于大规模数据集。
实验结果
研究问题
- RQ1通过使用固定NTK对内层优化问题进行凸化,是否能提升基于隐式梯度的数据集蒸馏性能?
- RQ2对神经网络架构进行重参数化在多大程度上能减少隐式梯度计算中的偏差?
- RQ3RCIG在不同复杂度和类别数量的数据集上,相较于现有SOTA方法的性能提升程度如何?
- RQ4通过RCIG进行数据集蒸馏是否能有效防御成员推断攻击?
- RQ5哪些超参数设置(如内层步数、Hessian逆步数)能在不同数据集上实现最优性能?
主要发现
- 在每类仅使用一张图像的情况下,RCIG在ImageNet上的准确率相比之前SOTA提升了108%,达到15.6%的top-1准确率。
- 在Tiny-ImageNet上,RCIG相比先前最先进方法实现了66%的性能提升,表明其在更小、更复杂数据集上也具有强大泛化能力。
- 在CIFAR-100上,RCIG相比之前SOTA性能提升了37%,证实其在多个基准上的有效性。
- 该方法对成员推断攻击表现出高度鲁棒性,使用蒸馏数据训练的模型在多种攻击类型下AUC值较低(例如0.53),表明具有良好的隐私保护能力。
- 消融实验表明,同时使用隐式梯度与Hessian逆步数(nH−1 > 0)能显著提升准确率,最优性能出现在ninner = 20且nH−1 = 20时。
- 得益于训练过程中子采样的反向传播,RCIG能高效扩展至大规模数据集,且内存占用未增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。