[论文解读] Optimizing Black-box Metrics with Adaptive Surrogates
本文提出一种方法,通过将黑箱机器学习指标(如F值或Precision@K)建模为少量可微代理损失的单调函数,来优化这些指标。利用有限差分和局部线性插值估计代理空间中的梯度,该方法执行非精确投影梯度下降,在光滑性假设下实现收敛,即使在指标数学形式未知的情况下,性能也与已知指标方法相当。
We address the problem of training models with black-box and hard-to-optimize metrics by expressing the metric as a monotonic function of a small number of easy-to-optimize surrogates. We pose the training problem as an optimization over a relaxed surrogate space, which we solve by estimating local gradients for the metric and performing inexact convex projections. We analyze gradient estimates based on finite differences and local linear interpolations, and show convergence of our approach under smoothness assumptions with respect to the surrogates. Experimental results on classification and ranking problems verify the proposal performs on par with methods that know the mathematical formulation, and adds notable value when the form of the metric is unknown.
研究动机与目标
- 解决在无闭式梯度可用时,机器学习中非可分解、难以优化的评估指标的优化挑战。
- 通过将黑箱指标表示为少量易于优化的代理损失的单调函数,实现使用黑箱指标训练模型。
- 开发一种无需依赖指标数学形式的基于梯度的优化框架,利用包含真实标签的小型验证集。
- 在未知指标函数的光滑性假设下,确保收敛至驻点。
- 通过实证验证,该方法性能与指标感知基线方法相当,并在指标真正未知时提供性能增益。
提出的方法
- 该方法在K维代理空间中表述优化问题,其中K << d,d为模型参数数量。
- 将黑箱指标M建模为未知的单调函数ψ: ℝ₊ᴷ → ℝ,该函数以K个代理损失ℓ(θ)为输入。
- 通过在模型参数扰动上使用有限差分和局部线性插值,估计ψ相对于代理损失的梯度。
- 使用非精确投影在代理空间中执行投影梯度下降,其中投影通过在原始参数空间中求解凸子问题计算得出。
- 该算法采用自适应步长和基于扰动的梯度估计,在ψ的光滑性假设下具有收敛性保证。
- 该方法应用于分类、排序和代理标签问题,利用小型验证集指导指标估计。
实验结果
研究问题
- RQ1当指标的数学形式未知或不可微时,能否在机器学习中优化黑箱指标?
- RQ2在无法访问其解析导数的情况下,如何有效估计黑箱指标的梯度?
- RQ3能否通过基于代理的梯度估计,在黑箱指标的优化中收敛至驻点?
- RQ4当指标形式已知时,该方法在性能上是否能与指标感知训练方法相媲美?
- RQ5当真实指标为黑箱且无先验公式时,该方法是否能提供显著的性能增益?
主要发现
- 在F值任务中,该方法在测试集上达到G-mean为0.803,与最佳基线方法性能相当,即使在指标未知的情况下也如此。
- 仅使用10次扰动,该方法在Business数据集上实现了0.796的宏F值,与使用1000次扰动时获得的0.796结果非常接近。
- 在KDD Cup 2008排序任务中,该方法使用大小为100的mini-batch和固定的σ = 1.5,跨多次运行表现出稳定性能。
- 基于局部线性插值的梯度估计误差对K的依赖性较弱,当K从2增加到10时,均方误差仅缓慢上升。
- 在训练标签存在噪声且真实指标未知的代理标签学习场景中,该方法优于基线方法。
- 理论分析表明,在未知函数ψ(将代理映射至指标)的光滑性假设下,该方法可收敛至驻点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。