Skip to main content
QUICK REVIEW

[论文解读] Score Function Gradient Estimation to Widen the Applicability of Decision-Focused Learning

Mattia Silvestri, Senne Berden|arXiv (Cornell University)|Jul 11, 2023
Explainable Artificial Intelligence (XAI)Computer Science被引用 3
一句话总结

本文提出一种基于评分函数梯度估计(SFGE)的决策聚焦学习框架,用于训练具有参数化目标函数和约束函数的优化问题的预测模型,即使在非线性和随机设置下也适用。通过预测参数分布并利用SFGE,该方法克服了组合优化中的零梯度问题,在0-1背包问题和多覆盖问题上均实现了比预测聚焦学习更低的遗憾值和不可行性。

ABSTRACT

Many real-world optimization problems contain parameters that are unknown before deployment time, either due to stochasticity or to lack of information (e.g., demand or travel times in delivery problems). A common strategy in such cases is to estimate said parameters via machine learning (ML) models trained to minimize the prediction error, which however is not necessarily aligned with the downstream task-level error. The decision-focused learning (DFL) paradigm overcomes this limitation by training to directly minimize a task loss, e.g. regret. Since the latter has non-informative gradients for combinatorial problems, state-of-the-art DFL methods introduce surrogates and approximations that enable training. But these methods exploit specific assumptions about the problem structures (e.g., convex or linear problems, unknown parameters only in the objective function). We propose an alternative method that makes no such assumptions, it combines stochastic smoothing with score function gradient estimation which works on any task loss. This opens up the use of DFL methods to nonlinear objectives, uncertain parameters in the problem constraints, and even two-stage stochastic optimization. Experiments show that it typically requires more epochs, but that it is on par with specialized methods and performs especially well for the difficult case of problems with uncertainty in the constraints, in terms of solution quality, scalability, or both.

研究动机与目标

  • 克服现有决策聚焦学习(DFL)方法的局限性,这些方法假设目标函数为线性,且仅允许在目标函数中预测参数。
  • 将DFL扩展至不确定参数同时出现在目标函数和约束函数中的问题,包括非线性和组合优化问题。
  • 在随机优化设置(如具有后继行动和惩罚成本的两阶段问题)中,实现预测模型的有效训练。
  • 通过分布预测和评分函数梯度估计(SFGE)解决组合优化中的零梯度问题。
  • 证明基于SFGE的DFL在决策质量和可行性方面优于传统预测聚焦学习(PFL),尤其在高惩罚系数情形下表现更优。

提出的方法

  • 使用神经网络预测未知参数的分布,而非点估计,以支持基于梯度的优化。
  • 采用评分函数梯度估计(REINFORCE)计算任务损失相对于预测模型参数的梯度,即使优化解不可微也能实现。
  • 使用事后遗憾损失作为任务目标,该损失可衡量因预测误差导致的决策次优性,即使参数影响约束条件也适用。
  • 将该方法应用于确定性问题(如具有不确定权重的0-1背包问题)和随机问题(如具有随机需求和后继成本的加权多覆盖问题)。
  • 通过SFGE在优化过程内反向传播,实现预测与决策质量的端到端联合优化。
  • 对于随机问题,使用概率模型(多元正态分布)预测需求分布,并与样本平均近似法(SAA)进行对比。

实验结果

研究问题

  • RQ1评分函数梯度估计是否能够使决策聚焦学习适用于参数同时出现在目标函数和约束函数中的优化问题?
  • RQ2基于SFGE的DFL是否能有效处理传统隐式微分失效的非线性和组合优化问题?
  • RQ3在随机优化设置下,基于SFGE的DFL是否在决策质量和可行性方面优于预测聚焦学习?
  • RQ4在两阶段随机问题中,随着不确定度或惩罚成本的增加,该方法的可扩展性如何?
  • RQ5基于SFGE的DFL是否能推广到真实参数不仅影响目标函数,还通过约束影响可行性的场景?

主要发现

  • 在具有不确定权重的0-1背包问题中,SFGE将事后相对遗憾值从PFL的1.18±0.62降低至0.850±0.264,可行性提升12%。
  • 在ρ=10的加权多覆盖问题中,SFGE的相对事后遗憾值为3.47±1.73,显著低于PFL的17.8±13.3。
  • 在ρ=10时,SFGE将不可行性比率从PFL的0.63±0.11降低至0.12±0.06,表明约束满足性显著改善。
  • 即使在100个采样场景下,PFL+SAA的遗憾值也未优于SFGE,且推理阶段计算成本至少高出10倍。
  • 随着惩罚系数增加,SFGE与PFL之间的性能差距进一步扩大,表明SFGE在高成本不确定性下更具鲁棒性。
  • SFGE使原本对DFL不可行的问题(如约束依赖参数和非线性目标函数的问题)实现了有效训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。