[论文解读] AM-LFS: AutoML for Loss Function Search
AM-LFS 提出了一种基于 REINFORCE 的强化学习方法,用于在训练过程中自动搜索最优损失函数,其统一的搜索空间涵盖了主流损失函数。通过双层优化动态调整损失函数参数,在图像分类、人脸识别和行人重识别基准上实现了最先进性能,且无需修改网络结构。
Designing an effective loss function plays an important role in visual analysis. Most existing loss function designs rely on hand-crafted heuristics that require domain experts to explore the large design space, which is usually sub-optimal and time-consuming. In this paper, we propose AutoML for Loss Function Search (AM-LFS) which leverages REINFORCE to search loss functions during the training process. The key contribution of this work is the design of search space which can guarantee the generalization and transferability on different vision tasks by including a bunch of existing prevailing loss functions in a unified formulation. We also propose an efficient optimization framework which can dynamically optimize the parameters of loss function's distribution during training. Extensive experimental results on four benchmark datasets show that, without any tricks, our method outperforms existing hand-crafted loss functions in various computer vision tasks.
研究动机与目标
- 为解决手工设计损失函数存在的次优性、耗时和任务特异性问题。
- 开发一种可泛化且可迁移的损失函数搜索空间,适用于多种视觉任务。
- 设计一种高效的双层优化框架,在训练过程中联合优化网络和损失函数参数。
- 实现端到端训练,支持动态损失函数自适应,提升模型判别能力,且无需重新训练。
提出的方法
- 将现有损失函数(如 softmax、基于边距的损失、焦点损失等)统一为参数化形式,根据样本难易程度调整梯度。
- 将损失函数参数建模为可微分的概率分布,支持通过 REINFORCE 实现基于梯度的优化。
- 采用双层优化框架:内层循环最小化采样损失关于网络权重的损失,外层循环最大化验证性能(如准确率、mAP)关于损失分布参数的性能。
- 通过根据样本难易程度将样本分配到不同区间,动态平衡类内与类间距离,每个区间独立优化参数。
- 框架支持端到端训练,无需网络结构修改,可无缝集成至现有模型中,实现即插即用。
- 通过监控分布参数收敛性确保训练稳定性,避免噪声奖励追踪。
实验结果
研究问题
- RQ1统一的、参数化的搜索空间是否能有效表示多种视觉任务中多样化的最先进损失函数?
- RQ2如何将损失函数搜索建模为可微分的强化学习问题,以实现在训练过程中的动态优化?
- RQ3所提出的双层优化框架是否相比手工设计的损失函数具有更好的泛化能力和可迁移性?
- RQ4搜索空间超参数(如区间数量、批量大小等)的最优配置是什么,以兼顾性能与效率?
主要发现
- AM-LFS 在 CIFAR-10、MegaFace、Market-1501 和 DukeMTMC-reID 上均优于手工设计的损失函数,且无需修改网络结构即达到最先进性能。
- 在 Market-1501 上,AM-LFS 在 B=32 时达到 84.4% mAP,优于基线 SphereReID 模型。
- 在 DukeMTMC-reID 上,AM-LFS 在 B=32 时达到 69.8% mAP,展现出强大的跨数据集迁移能力。
- 最优区间数(M)为 6,M=3 时因粒度不足导致性能较差,而 M=10 时引发优化不稳定性。
- 梯度可视化显示,AM-LFS 降低了简单样本(类内距离小)的梯度,同时更关注困难样本,从而增强类间判别能力。
- 收敛性分析表明训练稳定,分布参数随训练轮次逐渐收敛,说明损失函数分布的优化可靠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。