[论文解读] Marginalizing Corrupted Features
本文提出了一种名为边际化损坏特征(MCF)的新正则化技术,通过在训练数据的无限多个损坏版本上进行训练,实现模型泛化性能的提升。这些损坏版本通过在损坏分布上进行解析边缘化推导得出。该方法在多个数据集上实现了最先进(state-of-the-art)的测试准确率,尤其在使用dropout和泊松损坏时表现优异,同时通过二次损失和指数损失的闭式解,以及对逻辑损失的实用近似,保持了计算效率。
The goal of machine learning is to develop predictors that generalize well to test data. Ideally, this is achieved by training on an almost infinitely large training data set that captures all variations in the data distribution. In practical learning settings, however, we do not have infinite data and our predictors may overfit. Overfitting may be combatted, for example, by adding a regularizer to the training objective or by defining a prior over the model parameters and performing Bayesian inference. In this paper, we propose a third, alternative approach to combat overfitting: we extend the training set with infinitely many artificial training examples that are obtained by corrupting the original training data. We show that this approach is practical and efficient for a range of predictors and corruption models. Our approach, called marginalized corrupted features (MCF), trains robust predictors by minimizing the expected value of the loss function under the corruption model. We show empirically on a variety of data sets that MCF classifiers can be trained efficiently, may generalize substantially better to test data, and are also more robust to feature deletion at test time.
研究动机与目标
- 通过基于数据损坏提出一种新的正则化策略,解决在有限数据集上训练的机器学习模型的过拟合问题。
- 开发一种计算高效的算法,避免显式生成损坏训练样本所带来的高昂计算成本。
- 通过最小化在损坏模型下的期望损失,而非依赖参数先验或正则化项,实现鲁棒的泛化能力。
- 在多种数据类型(包括连续型、计数型和稀疏特征)上,通过高斯、泊松和dropout损坏模型,展示MCF的有效性。
提出的方法
- 该方法通过使用固定的、预定义的损坏模型(如高斯、泊松或dropout噪声)对每个训练样本进行损坏,构建扩展的数据分布。
- 通过解析计算损坏数据分布上的期望损失,避免显式采样损坏样本。
- 对于二次损失和指数损失,利用损坏分布的矩生成函数推导出闭式解。
- 对于逻辑损失,采用变分上界和实用近似方法,通过对数域计算和偏移技术确保数值稳定性。
- 优化过程使用从期望损失中导出的梯度,使标准优化算法能够高效训练。
- 该框架支持多种损坏模型,并适用于线性预测器,计算效率与训练样本数量呈线性关系。
实验结果
研究问题
- RQ1在无限多个损坏训练样本的集合上进行训练,是否能在不显式数据增强的情况下提升泛化性能?
- RQ2在不采样的前提下,最小化损坏分布上的期望损失是否在计算上可行?
- RQ3与标准正则化方法和贝叶斯方法相比,MCF在测试准确率和鲁棒性方面表现如何?
- RQ4在不同数据类型上,哪些损坏模型(高斯、泊松、dropout)能取得最佳性能?
- RQ5MCF能否提升测试时对特征删除的鲁棒性,尤其是在类似dropout的噪声下?
主要发现
- MCF在多个数据集上显著提升了测试准确率,尤其在使用泊松和dropout损坏时,优于标准基线方法。
- 该方法在低数据量场景下,泛化能力优于传统正则化和贝叶斯推断方法。
- 对于逻辑损失,变分上界提供了稳定且高效的训练目标,通过对数偏移和替代对数表达式确保了数值稳定性。
- 二次损失和指数损失的闭式解使得模型训练时间与训练样本数量呈线性关系。
- MCF分类器在测试时对特征删除表现出更强的鲁棒性,表明其对输入扰动具有更强的不变性。
- 泊松损坏在计数型数据(如文本分类)上始终能提升测试准确率,且无需超参数调优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。