Skip to main content
QUICK REVIEW

[论文解读] An Online Method for Distributionally Deep Robust Optimization

Qi Qi, Zhishuai Guo|arXiv (Cornell University)|Jun 17, 2020
Stochastic Gradient Optimization Techniques参考文献 44被引用 5
一句话总结

本文提出了一种无对偶性的在线随机方法,用于深度学习中的分布鲁棒优化(DRO),将最小-最大公式转化为最小化问题,以避免高维对偶变量。在Polyak-Łojasiewicz(PL)条件下,该方法在无需大批次的情况下实现了最优样本复杂度,从而实现了高效在线学习并提升了鲁棒性。

ABSTRACT

In this paper, we propose a practical online method for solving a distributionally robust optimization (DRO) for deep learning, which has important applications in machine learning for improving the robustness of neural networks. In the literature, most methods for solving DRO are based on stochastic primal-dual methods. However, primal-dual methods for deep DRO suffer from several drawbacks: (1) manipulating a high-dimensional dual variable corresponding to the size of data is time expensive; (2) they are not friendly to online learning where data is coming sequentially. To address these issues, we transform the min-max formulation into a minimization formulation and propose a practical duality-free online stochastic method for solving deep DRO with KL divergence regularization. The proposed online stochastic method resembles the practical stochastic Nesterovs method in several perspectives that are widely used for learning deep neural networks. Under a Polyak-Lojasiewicz (PL) condition, we prove that the proposed method can enjoy an optimal sample complexity without any requirements on large batch size. Of independent interest, the proposed method can be also used for solving a family of stochastic compositional problems.

研究动机与目标

  • 解决现有随机原始-对偶方法在深度DRO中的局限性,这些方法因高维对偶变量导致计算成本过高。
  • 克服原始-对偶方法与在线学习环境(数据按顺序到达)的不兼容性。
  • 开发一种适用于顺序数据的高效且可扩展的深度DRO在线优化方法。
  • 在Polyak-Łojasiewicz(PL)条件下实现最优样本复杂度,且不依赖大批次。
  • 将该方法推广至DRO以外的更广泛类别的随机复合优化问题。

提出的方法

  • 将DRO的最小-最大公式转化为最小化问题,以消除对高维对偶变量的需求。
  • 提出一种无对偶性的在线随机优化方法,利用KL散度正则化来建模分布鲁棒性。
  • 将随机Nesterov方法的结构适配至DRO设置,利用其有利的收敛特性。
  • 通过按顺序处理数据实现在线学习,使该方法适用于数据流环境。
  • 采用随机逼近框架,基于到达的迷你批次数据更新模型参数。
  • 利用Polyak-Łojasiewicz(PL)条件,建立具有最优样本复杂度的收敛性保证。

实验结果

研究问题

  • RQ1能否设计一种无对偶性的在线方法用于深度DRO,以避免高维对偶变量带来的计算负担?
  • RQ2所提出的方法在数据按顺序到达的在线设置中是否仍能保持强收敛保证?
  • RQ3在标准假设下,该方法是否能在不使用大批次的情况下实现最优样本复杂度?
  • RQ4该方法在多大程度上可推广至其他随机复合优化问题?
  • RQ5在实践中,该方法与现有原始-对偶方法相比,在收敛速度和鲁棒性方面表现如何?

主要发现

  • 所提出的无对偶方法消除了维护和更新高维对偶变量的需求,显著降低了计算开销。
  • 在Polyak-Łojasiewicz(PL)条件下,即使不使用大批次,该方法仍实现了最优样本复杂度。
  • 该方法与在线学习兼容,可高效地在顺序到达的数据流上进行训练。
  • 该方法的收敛行为类似于随机Nesterov方法,受益于类似的加速特性。
  • 该方法可扩展用于求解分布鲁棒深度学习以外的一类随机复合优化问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。