[论文解读] Large-scale Optimization of Partial AUC in a Range of False Positive Rates
该论文提出了一种可扩展的随机优化方法,用于在大规模和深度学习设置下,针对指定范围的假阳性率(FPR)最大化部分AUC。通过将问题表述为非光滑的差为凸(DC)规划问题,并结合Moreau包络平滑与随机块坐标下降,该方法实现了$\tilde{O}(1/\epsilon^6)$的收敛复杂度,从而实现了对线性模型和深度神经网络的高效训练,并具备理论保证。
The area under the ROC curve (AUC) is one of the most widely used performance measures for classification models in machine learning. However, it summarizes the true positive rates (TPRs) over all false positive rates (FPRs) in the ROC space, which may include the FPRs with no practical relevance in some applications. The partial AUC, as a generalization of the AUC, summarizes only the TPRs over a specific range of the FPRs and is thus a more suitable performance measure in many real-world situations. Although partial AUC optimization in a range of FPRs had been studied, existing algorithms are not scalable to big data and not applicable to deep learning. To address this challenge, we cast the problem into a non-smooth difference-of-convex (DC) program for any smooth predictive functions (e.g., deep neural networks), which allowed us to develop an efficient approximated gradient descent method based on the Moreau envelope smoothing technique, inspired by recent advances in non-smooth DC optimization. To increase the efficiency of large data processing, we used an efficient stochastic block coordinate update in our algorithm. Our proposed algorithm can also be used to minimize the sum of ranked range loss, which also lacks efficient solvers. We established a complexity of $ ilde O(1/ε^6)$ for finding a nearly $ε$-critical solution. Finally, we numerically demonstrated the effectiveness of our proposed algorithms for both partial AUC maximization and sum of ranked range loss minimization.
研究动机与目标
- 解决大规模和深度学习设置下,部分AUC优化缺乏可扩展且理论基础坚实的算法的问题。
- 开发一种方法,在用户定义的假阳性率范围内最大化部分AUC,该指标在具有实际FPR约束的应用中比完整AUC更具相关性。
- 通过克服现有方法仅限于线性模型或需要全批量处理的局限性,实现对非线性模型(包括深度神经网络)的高效训练。
- 提供一个统一框架,不仅适用于部分AUC最大化,还可用于最小化排序范围损失之和(sum of ranked range loss),作为标准损失之和目标的稳健替代方案。
- 为在非光滑DC规划下寻找$\epsilon$-临界解,建立$\tilde{O}(1/\epsilon^6)$的严格收敛复杂度边界。
提出的方法
- 将部分AUC最大化问题重新表述为非光滑差为凸(DC)规划问题,使其适用于平滑预测函数(如深度神经网络)。
- 利用Moreau包络近似DC公式中的非光滑分量,将问题转化为适合基于梯度优化的光滑问题。
- 采用近似梯度下降方法,其中梯度通过随机块坐标下降(SBCD)估计,以求解凸分量的近端子问题。
- 算法在每次迭代中随机采样正负样本点,确保每次迭代计算成本低,具备处理大规模数据的可扩展性。
- 通过识别其为部分AUC优化的特例,将该方法扩展至最小化排序范围损失之和(SoRR)损失。
- 为寻找$\epsilon$-临界解,建立了$\tilde{O}(1/\epsilon^6)$的收敛复杂度,与非光滑非凸问题中最优已知边界一致。
实验结果
研究问题
- RQ1部分AUC优化能否在大规模数据集和深度神经网络上实现高效扩展,从而克服现有基于批量处理或仅限线性模型方法的局限性?
- RQ2当标准DC求解器因非光滑性而失效时,如何有效求解用于部分AUC最大化的非光滑DC规划问题?
- RQ3在非光滑、非凸设置下,针对部分AUC优化的随机梯度基方法的理论收敛复杂度是多少?
- RQ4所提出的框架能否推广至其他鲁棒损失函数(如排序范围损失之和)?
- RQ5结合Moreau包络平滑与随机块坐标下降,是否能产生一种实用且可证明收敛的算法,用于大规模部分AUC优化?
主要发现
- 所提出的AGD-SBCD算法在寻找$\epsilon$-临界解时,实现了$\tilde{O}(1/\epsilon^6)$的收敛复杂度,与非光滑非凸优化问题中已知的最佳边界一致。
- 在CheXpert数据集上,该算法在$\mu = 10^{10}/N_{+}N_{-}$时达到了测试部分AUC为0.8500 ± 0.0017,表现出在医学影像数据上的强劲性能。
- 该方法成功训练了深度神经网络以实现部分AUC最大化,在CIFAR-10-LT和Tiny-ImageNet-200-LT等长尾数据集上展现出良好的可扩展性与有效性。
- 数值结果证实,该算法在GPU时间维度上,训练损失与部分AUC均表现出稳定收敛,且在不同$\mu$值下性能退化极小。
- 与基线方法相比,该算法在可扩展性和理论保证方面表现更优,尤其在完整AUC并非最相关性能指标的场景下优势显著。
- 该框架可推广至排序范围损失之和最小化,为标准损失之和训练目标提供了一种稳健的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。