Skip to main content
QUICK REVIEW

[论文解读] Dataset Meta-Learning from Kernel Ridge-Regression

Timothy Nguyen, Zhourong Chen|arXiv (Cornell University)|Oct 30, 2020
Advanced Neural Network Applications参考文献 36被引用 6
一句话总结

本文提出核诱导点(KIP),一种元学习算法,通过核岭回归(KRR)近似生成紧凑、被污染或蒸馏的数据集,在 MNIST 和 CIFAR-10 上实现最先进性能,图像数量最多减少至原量的 1/100。KIP 实现了数据集压缩一到两个数量级,并生成可迁移、保护隐私的数据集,即使在非懒惰神经网络设置下也表现有效。

ABSTRACT

One of the most fundamental aspects of any machine learning algorithm is the training data used by the algorithm. We introduce the novel concept of $ε$-approximation of datasets, obtaining datasets which are much smaller than or are significant corruptions of the original training data while maintaining similar model performance. We introduce a meta-learning algorithm called Kernel Inducing Points (KIP) for obtaining such remarkable datasets, inspired by the recent developments in the correspondence between infinitely-wide neural networks and kernel ridge-regression (KRR). For KRR tasks, we demonstrate that KIP can compress datasets by one or two orders of magnitude, significantly improving previous dataset distillation and subset selection methods while obtaining state of the art results for MNIST and CIFAR-10 classification. Furthermore, our KIP-learned datasets are transferable to the training of finite-width neural networks even beyond the lazy-training regime, which leads to state of the art results for neural network dataset distillation with potential applications to privacy-preservation.

研究动机与目标

  • 通过优化数据集而非模型来解决机器学习中的可扩展性和隐私问题。
  • 开发一种生成代理数据集的方法,即使在数据集规模减小或被污染的情况下仍能保持高性能。
  • 通过数据集蒸馏减少内存和延迟,实现高效推理和超参数搜索。
  • 探索在核学习和神经网络学习中数据集近似的理论与实际极限。
  • 创建可迁移、保护隐私的数据集,其性能在污染条件下优于自然数据。

提出的方法

  • 提出数据集 ε-近似概念,将数据集压缩和污染形式化为模型性能保持的等价问题。
  • 引入核诱导点(KIP),一种元学习算法,通过学习一组少量合成数据点来近似完整数据集的核岭回归解。
  • 利用无限宽神经网络与 KRR 之间的对应关系,推导出用于数据集生成的可微优化目标。
  • 采用一种称为标签求解(Label Solve, LS)的变体,以闭式解计算最优标签,实现特征与标签的独立优化。
  • 在训练过程中对图像施加高达 90% 的噪声污染,以评估鲁棒性与隐私权衡。
  • 采用两阶段优化:首先通过 KIP 学习特征,然后通过 LS 精炼标签,支持端到端联合优化。

实验结果

研究问题

  • RQ1我们能否学习到一个小型合成数据集,在 ε 误差范围内近似完整数据集的泛化性能?
  • RQ2KIP 在压缩数据集用于核岭回归和神经网络训练方面效果如何?
  • RQ3KIP 生成的数据集在高程度像素污染下能保持多大程度的鲁棒性,同时维持高准确率?
  • RQ4KIP 生成的数据集能否被迁移用于训练有限宽度神经网络,即使在非懒惰训练范式下?
  • RQ5与现有数据集蒸馏和子集选择方法相比,KIP 在样本效率和性能方面表现如何?

主要发现

  • KIP 仅使用 1,000 张图像就在 MNIST 和 CIFAR-10 上实现最先进性能,优于同规模的自然数据集,甚至在某些情况下优于更大规模的自然数据集。
  • 在 MNIST 上,使用 1,000 张 KIP 生成的图像并施加 90% 像素污染,测试准确率达到 90.9%,超过 1,000 张被污染的自然图像(准确率 75.0%)。
  • 在 CIFAR-10 上,1,000 张 KIP 图像在 90% 污染下达到 45.0% 测试准确率,超过 1,000 张自然图像(35.4%)和 1,000 张被污染的自然图像(27.2%)。
  • 使用 10,000 张 KIP 图像,在 MNIST 上达到 97.9% 准确率,在 CIFAR-10 上达到 54.0% 准确率(交叉熵损失),优于同规模的自然数据集。
  • KIP 生成的数据集可迁移至有限宽度神经网络,在数据集蒸馏任务中实现最先进结果,即使在非懒惰训练范式下亦表现优异。
  • 该方法实现了显著的隐私权衡:90% 污染的 KIP 图像仍保持高准确率,表明其在隐私保护数据发布方面具有实用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。