[论文解读] DeepGUM: Learning Deep Robust Regression with a Gaussian-Uniform Mixture Model
该论文提出 DeepGUM,一种结合卷积神经网络(ConvNet)与高斯-均匀分布混合模型的深度鲁棒回归框架,以减轻训练过程中异常值的影响。通过在无监督异常值检测(期望最大化算法)与有监督学习(随机梯度下降)之间交替优化,DeepGUM 在均匀分布异常值污染下突破点超过 40%,在四个视觉任务中均优于 $L_2$、Huber 和 Biweight 损失,在准确性和鲁棒性方面表现更优。
In this paper, we address the problem of how to robustly train a ConvNet for regression, or deep robust regression. Traditionally, deep regression employs the L2 loss function, known to be sensitive to outliers, i.e. samples that either lie at an abnormal distance away from the majority of the training samples, or that correspond to wrongly annotated targets. This means that, during back-propagation, outliers may bias the training process due to the high magnitude of their gradient. In this paper, we propose DeepGUM: a deep regression model that is robust to outliers thanks to the use of a Gaussian-uniform mixture model. We derive an optimization algorithm that alternates between the unsupervised detection of outliers using expectation-maximization, and the supervised training with cleaned samples using stochastic gradient descent. DeepGUM is able to adapt to a continuously evolving outlier distribution, avoiding to manually impose any threshold on the proportion of outliers in the training set. Extensive experimental evaluations on four different tasks (facial and fashion landmark detection, age and head pose estimation) lead us to conclude that our novel robust technique provides reliability in the presence of various types of noise and protection against a high percentage of outliers.
研究动机与目标
- 解决标准 $L_2$ 损失在深度回归中对异常值(包括误标数据和异常样本)的敏感性问题。
- 开发一种可自动检测并降低异常值影响的方法,无需对异常值比例进行人工阈值设定。
- 使深度神经网络在高比例异常值污染场景下仍能可靠泛化,尤其适用于具有噪声标注的大规模数据集。
- 将概率异常值建模与端到端深度学习相结合,实现表示学习与鲁棒性的联合优化。
- 为深度学习流程提供一种可扩展、可训练的传统 M-估计器与鲁棒回归技术的替代方案。
提出的方法
- 在卷积神经网络的最后层使用高斯-均匀分布混合(GUM)模型,以高斯分布建模正常样本,以均匀分布建模异常值。
- 采用交替优化策略:通过无监督 EM 算法进行异常值检测,通过有监督 SGD 更新网络权重。
- 利用 EM 算法估计每个样本的潜在异常值概率,实现在反向传播过程中对训练样本的动态重加权。
- 将损失函数定义为 GUM 中对数似然的加权和,其中异常值概率可降低高残差样本的影响。
- 实施早停和自适应学习策略,以在异常值检测不稳定(尤其在高噪声相关性下)时防止过拟合。
- 端到端训练整个模型,使网络在学习鲁棒特征的同时,同步识别并抑制异常值的影响。
实验结果
研究问题
- RQ1在未知异常值比例的前提下,深度神经网络是否能在高异常值污染下实现稳健训练?
- RQ2在不同异常值分布下,DeepGUM 的突破点与 Huber 和 Biweight 等经典鲁棒回归方法相比如何?
- RQ3高斯-均匀分布混合模型在具有噪声标注的真实视觉任务中,对泛化性能的提升程度如何?
- RQ4基于 EM 的异常值检测机制是否能有效识别并抑制训练过程中误标数据和异常样本的影响?
- RQ5DeepGUM 在何种条件下会失效?当噪声结构与真实标签高度相关(如零均值、相关性污染)时,其适应能力如何?
主要发现
- 在 l-UGO 数据集上,DeepGUM 的突破点约为 40%,显著优于 Biweight 和 Huber 方法,后两者在异常值比例超过 30% 后性能与召回率均持续下降。
- 在 g-UGO 数据集上(异常值均匀分布),DeepGUM 的突破点超过 50%,展现出对高比例污染的强鲁棒性。
- 在异常值检测方面,DeepGUM 在突破点前始终维持接近 99% 的精确率与召回率,而 Biweight 和 Huber 在异常值比例增加时召回率逐步下降。
- 在 NGO 数据集(零均值、高度相关噪声)上,由于收敛性差触发早停,DeepGUM 性能退化情况与 $L_2$ 相似,但仍能自动恢复出合理解。
- 在四个真实世界任务(人脸关键点检测、时尚关键点检测、年龄估计与头部姿态估计)中,DeepGUM 的性能与最先进方法相当或更优,且通过假设检验验证了统计显著性。
- 该方法能有效降低在污染训练集上的失败率,尤其在均匀分布异常值下表现优异,并在高达 40–50% 训练样本被污染时仍能提供可靠性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。