[论文解读] Mixed-Integer Convex Nonlinear Optimization with Gradient-Boosted Trees Embedded
本文提出一种用于大规模混合整数凸非线性优化问题的分支定界算法,该问题嵌入梯度提升树(GBTs)和凸惩罚函数。通过利用GBTs的组合结构和惩罚函数的凸性,该方法实现了全局最优或紧的最优性间隙,在混凝土混合设计和化学催化实例中验证了其优越的下界性能,优于商业求解器。
Decision trees usefully represent sparse, high dimensional and noisy data. Having learned a function from this data, we may want to thereafter integrate the function into a larger decision-making problem, e.g., for picking the best chemical process catalyst. We study a large-scale, industrially-relevant mixed-integer nonlinear nonconvex optimization problem involving both gradient-boosted trees and penalty functions mitigating risk. This mixed-integer optimization problem with convex penalty terms broadly applies to optimizing pre-trained regression tree models. Decision makers may wish to optimize discrete models to repurpose legacy predictive models, or they may wish to optimize a discrete model that particularly well-represents a data set. We develop several heuristic methods to find feasible solutions, and an exact, branch-and-bound algorithm leveraging structural properties of the gradient-boosted trees and penalty functions. We computationally test our methods on concrete mixture design instance and a chemical catalysis industrial instance.
研究动机与目标
- 解决在大规模混合整数非线性规划中优化预训练梯度提升树模型的挑战。
- 集成凸惩罚函数以减轻GBT预测中训练不足区域的风险。
- 开发精确与启发式方法,以寻找工业应用中的全局最优或近似最优解。
- 利用GBTs和凸惩罚函数的结构特性,提升分支定界算法的效率。
- 实现对遗留预测模型的再利用,以应对离散和非光滑约束下的决策问题。
提出的方法
- 将优化问题表述为包含GBT函数和凸惩罚项的混合整数凸非线性规划(MINLP)。
- 设计一种专门的分支定界算法,以利用GBTs的组合结构和惩罚函数的凸性。
- 采用伪成本分支并结合前瞻策略,优先对能改善GBT分量下界的关键变量进行分支。
- 使用不同前瞻大小(l = 1, 100)的强分支策略,动态优化边界并加速最优性间隙的收敛。
- 采用GBT模型的MILP形式,以实现与商业求解器的集成,支持精确的全局优化。
- 利用基于主成分分析(PCA)的接近度度量定义凸惩罚函数,以惩罚远离训练数据分布的解。
实验结果
研究问题
- RQ1如何高效地将梯度提升树嵌入带有凸惩罚函数的混合整数非线性优化问题?
- RQ2GBTs的哪些结构特性可被用于设计更快、更有效的分支定界算法?
- RQ3凸惩罚函数的引入在稀疏训练数据区域如何提升解的可靠性并降低风险?
- RQ4强分支结合前瞻策略在多大程度上改善了GBT嵌入问题的下界估计和最优性间隙收敛?
- RQ5所提方法在大规模工业实例中,是否能在下界质量与间隙收敛方面超越商业求解器Gurobi?
主要发现
- 所提出的分支定界算法在混凝土混合设计和化学催化实例中,相较于Gurobi 7.5.2,显著提升了下界并关闭了更大比例的最优性间隙。
- 使用公式(6)初始化伪成本优于随机排序,尤其在较高前瞻值下,因分支决策更优。
- 当λ = 1000时,前瞻大小l = 100比l = 1能关闭更多最优性间隙,表明更强的分支策略可更早、更频繁地提升下界。
- 当λ = 1时,增加前瞻大小影响甚微,表明GBT分量主导目标函数,因此更紧的GBT边界对强分支的有效性至关重要。
- 该方法即使在因GBT分裂导致高度离散化的领域中,也能成功收敛至证明精确的全局最优解,尽管间隙收敛仍具挑战。
- 由于共享结构特性,该方法可推广至其他树集成模型,如随机森林和极宽随机树。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。