[论文解读] Using learned optimizers to make models robust to input noise
本文提出使用元学习训练一种参数化优化器,以生成对输入噪声(尤其是训练期间未见的损坏)具有鲁棒性的深度学习模型。通过在带噪声的验证数据上进行元训练,所得到的模型在仅使用干净数据训练时,对未见过的噪声分布的泛化能力优于标准优化器(如Adam)。
State-of-the art vision models can achieve superhuman performance on image classification tasks when testing and training data come from the same distribution. However, when models are tested on corrupted images (e.g. due to scale changes, translations, or shifts in brightness or contrast), performance degrades significantly. Here, we explore the possibility of meta-training a learned optimizer that can train image classification models such that they are robust to common image corruptions. Specifically, we are interested training models that are more robust to noise distributions not present in the training data. We find that a learned optimizer meta-trained to produce models which are robust to Gaussian noise trains models that are more robust to Gaussian noise at other scales compared to traditional optimizers like Adam. The effect of meta-training is more complicated when targeting a more general set of noise distributions, but led to improved performance on half of held-out corruption tasks. Our results suggest that meta-learning provides a novel approach for studying and improving the robustness of deep learning models.
研究动机与目标
- 提升深度学习模型对输入噪声的鲁棒性,特别是对训练数据中不存在的损坏类型。
- 探究元学习优化器是否能将鲁棒性泛化到元训练期间使用的特定损坏类型之外。
- 在存在各种图像损坏的情况下,比较学习优化器与人工设计优化器(如Adam)的性能。
- 探索训练分布和元优化对泛化到未见损坏类型的影响。
提出的方法
- 使用两阶段学习框架元学习参数化优化器:内层在干净数据上训练,外层基于带噪声验证数据的性能进行优化。
- 使用小型全连接网络参数化优化器更新规则,以灵活学习自适应更新机制,包括动量和初始学习率调度。
- 采用截断进化策略优化外层参数,避免元学习中高方差梯度估计器的使用。
- 将外层目标定义为在包含注入噪声(如高斯噪声、脉冲噪声、模糊)的保留验证集上的交叉熵损失,该验证集在内层训练中未使用。
- 在子集损坏类型(如高斯噪声、亮度、对比度)上训练优化器,并在保留的损坏类型(如磨砂玻璃模糊、雾霾)上评估泛化性能。
- 与基线Adam(学习率调优)以及仅在干净数据上训练的优化器进行性能比较。
实验结果
研究问题
- RQ1元学习优化器能否生成对元训练期间未见的损坏类型也具备鲁棒性的模型?
- RQ2在特定损坏类型上进行元训练,如何影响其在其他未见损坏类型上的性能?
- RQ3当内层仅在干净数据上训练时,学习优化器是否优于人工设计的优化器(如Adam)?
- RQ4使用元学习优化器时,内层在带噪声数据与干净数据上训练的影响是什么?
- RQ5元学习优化器能否在包括几何和强度变化的多种损坏类型之间实现鲁棒性迁移?
主要发现
- 在高斯噪声上进行元训练的优化器,即使Adam经过超参数调优,其生成的模型在各种尺度的高斯噪声下也比Adam更具鲁棒性。
- 当仅在干净数据上进行内层训练时,学习优化器在除亮度外的所有外层测试损坏类型上均优于Adam和基线学习优化器。
- 在与元训练损坏类型匹配的带噪声数据上进行内层训练,显著提升了Adam和学习优化器的性能,表明数据增强在提升鲁棒性方面依然至关重要。
- 学习优化器在未见损坏(如磨砂玻璃模糊、雾霾)上表现出泛化能力,其在一半的保留损坏任务上优于Adam和基线学习优化器。
- 性能在不同损坏类型间存在差异,当在更广泛的损坏类型集上训练时,学习优化器在雾霾和亮度损坏上表现较差,表明在多样化损坏类型之间实现外层泛化仍具挑战。
- 结果表明,元学习为通过优化优化过程本身来提升模型鲁棒性提供了新颖且有效的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。