Skip to main content
QUICK REVIEW

[论文解读] End-to-End Learning for Stochastic Optimization: A Bayesian Perspective

Yves Rychener, Daniel Kuhn Tobias Sutter|arXiv (Cornell University)|Jun 7, 2023
Reservoir Engineering and Simulation Methods被引用 4
一句话总结

本文为随机优化中的端到端学习提供了贝叶斯解释,表明标准训练过程隐式地学习了一个后验贝叶斯动作映射。该文提出基于神经决策映射的新端到端算法,用于经验风险最小化和分布鲁棒优化,在合成与真实世界经济调度问题中,相较于基线方法,展现出更优的测试性能与鲁棒性。

ABSTRACT

We develop a principled approach to end-to-end learning in stochastic optimization. First, we show that the standard end-to-end learning algorithm admits a Bayesian interpretation and trains a posterior Bayes action map. Building on the insights of this analysis, we then propose new end-to-end learning algorithms for training decision maps that output solutions of empirical risk minimization and distributionally robust optimization problems, two dominant modeling paradigms in optimization under uncertainty. Numerical results for a synthetic newsvendor problem illustrate the key differences between alternative training schemes. We also investigate an economic dispatch problem based on real data to showcase the impact of the neural network architecture of the decision maps on their test performance.

研究动机与目标

  • 为随机优化中标准端到端学习提供严谨的贝叶斯解释。
  • 通过贝叶斯推断整合先验知识与正则化,解决预测-再优化与标准端到端方法的局限性。
  • 开发新型端到端训练算法,直接优化经验风险最小化(ERM)与分布鲁棒优化(DRO)的决策映射,提升泛化能力与鲁棒性。
  • 研究神经网络架构与观测信息丰富度对真实世界优化问题中决策映射性能的影响。
  • 在不确定环境中,证明结合约束感知与优化层架构的端到端学习方法优于传统基线方法。

提出的方法

  • 揭示了标准端到端学习在贝叶斯决策理论框架下,实际训练的是一个后验贝叶斯动作映射。
  • 提出两种新型端到端算法:一种用于经验风险最小化(ERM),另一种用于分布鲁棒优化(DRO),两者均通过基于梯度的优化进行训练。
  • 采用神经网络作为决策映射,将上下文输入映射到最优决策,其架构设计考虑了可行性约束(例如,通过CAL层中的缩放Sigmoid激活函数实现)。
  • 使用优化层(OPL)与约束感知层(CAL)架构,将底层优化问题的结构直接嵌入神经网络。
  • 通过嵌入优化层的Karush-Kuhn-Tucker(KKT)条件进行梯度反向传播,实现端到端训练。
  • 在合成报童问题与基于风电数据的真实世界经济调度问题上验证方法,比较不同观测类型与架构下的性能表现。
(a) NN vs ERM
(a) NN vs ERM

实验结果

研究问题

  • RQ1标准端到端学习在随机优化中与贝叶斯决策理论有何关联?
  • RQ2能否基于贝叶斯基础,系统性地将端到端学习扩展至ERM与DRO框架?
  • RQ3不同神经网络架构(OPL与CAL)如何影响学习到的决策映射的泛化能力与鲁棒性?
  • RQ4上下文信息丰富度(如短期观测与历史观测)对不确定优化问题中测试性能有何影响?
  • RQ5在具有非平稳数据的真实世界环境中,端到端学习与传统基线方法(如MLE与lag-1)相比表现如何?

主要发现

  • 端到端学习隐式地学习了一个后验贝叶斯动作映射,为训练过程提供了严谨的贝叶斯解释。
  • E2E-CAL架构结合历史观测,在10分钟频率下实现了最低的平均测试成本67.09,相较于基准最优解(60.69)在鲁棒性与可行性方面表现更优。
  • E2E-OPL-Softplus方法在所有观测类型与频率下均保持稳定的测试成本72.60,表明其具有鲁棒性,但成本高于CAL架构。
  • 最大似然估计(MLE)的测试成本最高(10分钟频率下为281.44),原因在于对称损失忽略了低估的非对称惩罚。
  • lag-1基线在10分钟频率下表现最佳(64.96),但在30分钟频率下因违反平稳性假设而失效。
  • 过于丰富的历史观测导致过拟合,如MLE与E2E-OPL-Softplus模型所示;而短期观测提供了对决策最有用的信息。
(b) NN vs Posterior Mean
(b) NN vs Posterior Mean

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。