Skip to main content
QUICK REVIEW

[论文解读] Biased Stochastic First-Order Methods for Conditional Stochastic Optimization and Applications in Meta Learning

Yifan Hu, Siqi Zhang|arXiv (Cornell University)|Feb 25, 2020
Stochastic Gradient Optimization Techniques参考文献 39被引用 15
一句话总结

该论文为条件随机优化(CSO)提出了一种有偏随机梯度下降(BSGD)方法,CSO是一类在元学习、因果推断和鲁棒学习中出现的具有嵌套期望的问题。通过使用条件样本的小批量来构建有偏梯度估计器,BSGD实现了改进的样本复杂度——在强凸、凸和弱凸目标函数下,其收敛速率与样本平均近似(SAA)相当或更优,该方法在MAML、不变回归和工具变量问题中得到了验证。

ABSTRACT

Conditional stochastic optimization covers a variety of applications ranging from invariant learning and causal inference to meta-learning. However, constructing unbiased gradient estimators for such problems is challenging due to the composition structure. As an alternative, we propose a biased stochastic gradient descent (BSGD) algorithm and study the bias-variance tradeoff under different structural assumptions. We establish the sample complexities of BSGD for strongly convex, convex, and weakly convex objectives under smooth and non-smooth conditions. Our lower bound analysis shows that the sample complexities of BSGD cannot be improved for general convex objectives and nonconvex objectives except for smooth nonconvex objectives with Lipschitz continuous gradient estimator. For this special setting, we propose an accelerated algorithm called biased SpiderBoost (BSpiderBoost) that matches the lower bound complexity. We further conduct numerical experiments on invariant logistic regression and model-agnostic meta-learning to illustrate the performance of BSGD and BSpiderBoost.

研究动机与目标

  • 为解决由于条件随机优化(CSO)的嵌套组合结构导致难以构造无偏梯度估计器的挑战。
  • 在可获得多个条件分布样本的前提下,开发一种实用且高效的CSO一阶随机优化方法。
  • 在目标函数满足不同光滑性和凸性假设的条件下,建立BSGD的理论样本复杂度边界。
  • 为凸CSO提供匹配的下界,验证BSGD收敛速率的最优性。
  • 在真实应用场景中对BSGD进行实证验证,包括元学习(MAML)、鲁棒逻辑回归和工具变量回归。

提出的方法

  • 提出有偏随机梯度下降(BSGD)作为CSO的一阶方法,利用条件样本的小批量构建有偏梯度估计器。
  • 基于内层小批量大小 $ m $ 推导梯度估计器的偏差和方差边界,表明偏差随 $ m $ 增大而减小。
  • 在强凸性、凸性和弱凸性条件下建立BSGD的收敛速率,并对光滑和Lipschitz连续的外函数 $ f_{\theta} $ 进行独立分析。
  • 采用新颖的分析框架,控制期望次优性和平稳性误差,同时考虑CSO的组合结构。
  • 将该方法应用于三个实际问题:鲁棒逻辑回归、模型无关元学习(MAML)和工具变量回归,各场景中均对超参数进行了调优。
  • 在总样本数 $ Q $ 固定的实验中,将BSGD与样本平均近似(SAA)及其他基线方法(如FO-MAML、Adam)进行比较。

实验结果

研究问题

  • RQ1有偏随机梯度方法是否能在条件随机优化中实现优于SAA的样本复杂度?
  • RQ2在不同结构假设下,CSO中梯度估计的偏差与方差之间最优权衡为何?
  • RQ3BSGD在元学习(MAML)、不变回归和工具变量问题中的实际表现如何?
  • RQ4BSGD的理论样本复杂度边界是否紧致,是否可通过匹配的下界得到验证?
  • RQ5在收敛速度和最终目标值方面,BSGD是否优于标准基线方法如Adam和FO-MAML?

主要发现

  • 对于光滑 $ f_{\xi} $ 的强凸目标函数,BSGD实现 $ \widetilde{\mathcal{O}}(\epsilon^{-2}) $ 的样本复杂度,与SAA的最佳已知速率一致。
  • 对于光滑 $ f_{\xi} $ 的凸目标函数,BSGD实现 $ \mathcal{O}(\epsilon^{-3}) $ 的复杂度,与Hu等(2019)的SAA速率一致。
  • 在弱凸情况下,BSGD对光滑 $ f_{\xi} $ 实现 $ \mathcal{O}(\epsilon^{-6}) $ 的复杂度,优于SAA的 $ \widetilde{\mathcal{O}}(\epsilon^{-8}) $ 速率。
  • 数值结果表明,BSGD在不变逻辑回归中优于SAA,尤其当 $ \sigma_2 $ 较大时,在所有 $ Q $ 和 $ m $ 设置下均取得更低的目标值。
  • 在MAML实验中,BSGD在 $ Q = 10^7 $、$ m = 10 $ 时达到最低的平均目标值,优于FO-MAML和Adam,且在最终目标值和稳定性方面表现更优。
  • 该方法在不同内层小批量大小 $ m $ 下表现出鲁棒性,性能稳定且方差低,尤其在高噪声环境下表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。