[论文解读] Deep pNML: Predictive Normalized Maximum Likelihood for Deep Neural Networks
本文提出 Deep pNML,一种用于深度神经网络的预测归一化最大似然框架,在准确率和对数损失方面优于标准经验风险最小化(ERM),尤其在标签噪声和对抗性攻击下表现更优。该方法引入了一种逐点可学习性度量(Γ),用于检测分布外样本和对抗性样本,并将该方法扩展为一种‘双重通用’方案,用于模型类别选择,在 CIFAR10 和 MNIST 上对不同 DNN 架构和超参数均实现了卓越性能。
The Predictive Normalized Maximum Likelihood (pNML) scheme has been recently suggested for universal learning in the individual setting, where both the training and test samples are individual data. The goal of universal learning is to compete with a ``genie'' or reference learner that knows the data values, but is restricted to use a learner from a given model class. The pNML minimizes the associated regret for any possible value of the unknown label. Furthermore, its min-max regret can serve as a pointwise measure of learnability for the specific training and data sample. In this work we examine the pNML and its associated learnability measure for the Deep Neural Network (DNN) model class. As shown, the pNML outperforms the commonly used Empirical Risk Minimization (ERM) approach and provides robustness against adversarial attacks. Together with its learnability measure it can detect out of distribution test examples, be tolerant to noisy labels and serve as a confidence measure for the ERM. Finally, we extend the pNML to a ``twice universal'' solution, that provides universality for model class selection and generates a learner competing with the best one from all model classes.
研究动机与目标
- 开发一种适用于深度神经网络的通用学习框架,使其在个体设置下可与最优的“全知学习者”相媲美。
- 提出一种基于最小-最大后悔的逐点可学习性度量(Γ),用于量化学习特定数据点的难度。
- 与标准 ERM 相比,提升对噪声标签和对抗性样本的鲁棒性。
- 将 pNML 框架扩展为一种‘双重通用’方案,可在不同超参数(如微调层数)下选择最佳模型类别。
- 在标准基准(CIFAR10、MNIST)上验证该方法,并证明其在准确率、对数损失和泛化检测方面的优越性。
提出的方法
- pNML 预测器定义为 q_pNML(y|z^N;x) = max_θ p_θ(y|x,z^N) / sum_y max_θ p_θ(y|x,z^N),确保实现最优的最小-最大后悔。
- 后悔度量 Γ = log(sum_y max_θ p_θ(y|x,z^N)) 作为单个数据点可学习性的逐点度量。
- 该方法使用微调阶段来为每个测试样本优化模型参数,使 pNML 能够针对每个测试实例自适应调整。
- 双重通用方法结合了多个模型类别(如不同微调层数)的 pNML,为每个测试样本选择表现最佳的模型。
- 该框架使用标准 DNN 并以对数损失作为评估指标,pNML 通过在模型参数上进行最大化计算得出。
- 该方法在 CIFAR10 和 MNIST 上通过准确率、对数损失和后悔度量进行评估,并与 ERM 和全知基准进行比较。
实验结果
研究问题
- RQ1pNML 框架能否有效应用于深度神经网络,使其泛化能力超越 ERM?
- RQ2pNML 后悔度量(Γ)是否可作为 DNN 中单个数据点可学习性的可靠逐点指标?
- RQ3与 ERM 相比,pNML 在噪声训练标签和对抗性测试样本下的表现如何?
- RQ4能否通过一种‘双重通用’的 pNML 方法(在模型类别间选择,如微调层数)实现对 ERM 和单类别 pNML 的超越?
- RQ5pNML 框架是否足够鲁棒,能够检测分布外和对抗性测试样本?
主要发现
- 在 CIFAR10 上,双重通用 pNML 实现了 0.920 的测试准确率和 0.168 的对数损失,优于所有单个模型类别,并与最佳 ERM 性能相当。
- 在 MNIST 上,双重通用 pNML 实现了 0.950 的准确率和 0.081 的对数损失,甚至超越了最佳单模型 pNML 和 ERM。
- 在噪声标签(ε=0.05)下,pNML 维持了 0.27 的准确率和 1.72 的对数损失,显著优于 ERM 的 0.26 准确率和 3.22 对数损失。
- pNML 后悔度量(Γ)有效检测了分布外和对抗性样本,后悔值越高表示置信度越低,异常可能性越高。
- pNML 框架在对抗性攻击下表现出更优的鲁棒性,在 FGSM 攻击下保持了更低的对数损失和更高的准确率,优于 ERM。
- 逐点后悔度量 Γ 被证明对 DNN 有信息量且有效,即使在其他泛化度量(如 VC 维)失效的“可学习”场景下依然成立。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。