[论文解读] Repurposing Pretrained Models for Robust Out-of-domain Few-Shot Learning
本文提出一种方法,可在无法访问原始元训练数据的情况下,将预训练的 MAML 检查点用于分布外 few-shot 学习。通过利用深度集成模型对参数不确定性的估计,自适应地调整学习率,并生成任务特定的对抗性样本,该方法在使用 SGD 和 Adam 优化器时,均显著提升了同域与跨域基准测试中的准确率与鲁棒性。
Model-agnostic meta-learning (MAML) is a popular method for few-shot learning but assumes that we have access to the meta-training set. In practice, training on the meta-training set may not always be an option due to data privacy concerns, intellectual property issues, or merely lack of computing resources. In this paper, we consider the novel problem of repurposing pretrained MAML checkpoints to solve new few-shot classification tasks. Because of the potential distribution mismatch, the original MAML steps may no longer be optimal. Therefore we propose an alternative meta-testing procedure and combine MAML gradient steps with adversarial training and uncertainty-based stepsize adaptation. Our method outperforms "vanilla" MAML on same-domain and cross-domains benchmarks using both SGD and Adam optimizers and shows improved robustness to the choice of base stepsize.
研究动机与目标
- 解决在实际应用场景中部署 few-shot 模型时面临的挑战,即由于隐私、许可或资源限制,无法访问元训练数据。
- 克服元训练与元测试任务之间分布偏移的问题,该问题会损害标准 MAML 在分布外设置下的性能。
- 在无法重新训练的情况下,提升对超参数选择(尤其是基础学习率)的鲁棒性。
- 开发一种元测试流程,通过引入不确定性和对抗性数据增强,使 MAML 的适应过程超越简单的梯度更新。
- 证明基于不确定性的自适应方法与对抗性训练可提升 few-shot 学习的泛化能力,而无需在原始元数据集上重新训练。
提出的方法
- 在支持集上使用深度集成模型,估计元测试期间的模型参数不确定性和输入梯度不确定性。
- 根据参数不确定性,按反比关系自适应调整 MAML 的学习率,减少在高不确定性参数上的更新。
- 利用输入梯度不确定性的信息,生成任务特定的对抗性样本,以增强适应过程中的鲁棒性。
- 应用基于不确定性的对抗性训练(UFGSM),在输入梯度不确定性较高的区域增加扰动。
- 将基于不确定性的步长自适应与对抗性数据增强相结合,形成一种与标准 MAML 不同的改进型元测试流程。
- 在元测试过程中冻结批归一化层,以验证高不确定性层对大更新敏感的假设。
实验结果
研究问题
- RQ1当无法在元训练数据上重新训练时,基于深度集成的不确定估计是否能提升元测试性能?
- RQ2基于不确定性的自适应学习率调度是否能增强 few-shot 学习中对基础学习率选择的鲁棒性?
- RQ3基于输入梯度不确定性的任务特定对抗性样本是否能提升在分布外 few-shot 任务上的泛化能力?
- RQ4与原始 MAML 相比,该方法在不同优化器(SGD 和 Adam)及数据集上的准确率与鲁棒性表现如何?
- RQ5在元测试过程中冻结高不确定性层(如批归一化层)是否有助于提升稳定性和性能?
主要发现
- 所提方法在同域与跨域 few-shot 基准测试中均优于原始 MAML,在所有指标上均取得更高准确率。
- 在 5 类 1 样本的 MiniImageNet 基准上,该方法使用 SGD+USA+UFGSM 达到 38.71% 的准确率,优于标准 FGSM 的 36.97%,证明了基于不确定性的对抗性训练的有效性。
- 使用 Adam 优化器时,该方法在 Flowers 数据集上达到 44.58% 的 top-1 准确率,优于基线(40.33%),并在不同优化器间表现出更强的鲁棒性。
- 在元测试过程中冻结批归一化层显著提升了 All 指标的表现,尤其在基础学习率较高(>0.1)时效果更明显,证实了更新高不确定性组件的风险。
- 该方法在基础学习率选择上表现出一致的鲁棒性提升,性能在广泛的学习率范围内保持稳定。
- 消融实验结果证实,对高不确定性参数使用大步长,或在高不确定性梯度上减少对抗扰动,均会导致准确率下降与鲁棒性减弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。