Skip to main content
QUICK REVIEW

[论文解读] Optimization over Continuous and Multi-dimensional Decisions with Observational Data

Dimitris Bertsimas, Christopher McCord|arXiv (Cornell University)|Jul 11, 2018
Advanced Bandit Algorithms Research参考文献 15被引用 12
一句话总结

本文提出了一种新颖且可计算的框架,通过整合预测性机器学习与因果推断,利用观察数据优化连续且多维的决策。该框架引入了不确定性惩罚机制以提升决策质量,在合成数据和真实世界的医疗保健应用中均表现出渐近一致性与优于无惩罚方法的性能,尤其在华法林剂量优化方面表现突出。

ABSTRACT

We consider the optimization of an uncertain objective over continuous and multi-dimensional decision spaces in problems in which we are only provided with observational data. We propose a novel algorithmic framework that is tractable, asymptotically consistent, and superior to comparable methods on example problems. Our approach leverages predictive machine learning methods and incorporates information on the uncertainty of the predicted outcomes for the purpose of prescribing decisions. We demonstrate the efficacy of our method on examples involving both synthetic and real data sets.

研究动机与目标

  • 解决在仅有观察数据可用、无法获取随机实验的情况下,优化连续且多维决策的挑战。
  • 开发一种可计算且渐近一致的方法,考虑预测结果中的不确定性,以选择最优决策。
  • 克服标准回归方法的局限性,后者仅最小化成本的点估计值,而未考虑预测不确定性。
  • 提供一种可推广的框架,适用于现实世界问题,如医疗保健中的个性化给药和收益管理中的动态定价。
  • 通过实证结果证明,不确定性惩罚可显著提升决策质量,相较于无惩罚方法在合成数据和真实数据集上均有显著改进。

提出的方法

  • 该框架使用预测性机器学习模型(如CART、随机森林、Lasso)从观察数据中估计条件期望成本 $ \mathbb{E}[c(z;Y) \mid X=x, Z=z] $。
  • 引入不确定性惩罚项,对预测成本方差较高的决策施加惩罚,以提升鲁棒性并减少对噪声估计的过拟合。
  • 利用可忽略性假设,确保观测到的结果分布反映了在该决策下的反事实条件期望。
  • 将优化问题表述为最小化结合了预测成本及其估计不确定性的惩罚经验风险,以确保可计算性和一致性。
  • 该方法设计为兼容线性模型与树基模型,从而在高维决策空间中实现可扩展性与可解释性。
  • 推导出有限样本的一般化与遗憾界,表明随着样本量增加,该方法会收敛至最优决策。

实验结果

研究问题

  • RQ1当仅有观察数据可用时,基于数据的优化框架能否有效处理连续且多维的决策?
  • RQ2与仅最小化成本点估计值相比,将预测结果的不确定性纳入考虑,如何提升决策质量?
  • RQ3在何种条件下可确保所提方法渐近最优,并一致地选择近似最优决策?
  • RQ4在样本外性能方面,不确定性惩罚与标准回归优化方法相比表现如何?
  • RQ5在数据有限的真实场景中,该方法相较于现有方法(如反事实风险最小化)的优越性在多大程度上得以体现?

主要发现

  • 不确定性惩罚在所有模型(CART、随机森林、Lasso)中均一致提升了性能,且在华法林剂量任务中,均方误差(MSE)的提升具有统计显著性。
  • 当训练样本量较小时,性能提升最为明显,凸显了该方法在低数据场景下的鲁棒性。
  • 在4000名患者的训练集中,不确定性惩罚的随机森林方法相比无惩罚版本将MSE降低了8.6%,p值为4.3×10⁻¹⁶。
  • 基于Lasso的方法相比其无惩罚版本提升了0.5%,同样具有统计显著性(p = 1.2×10⁻⁶)。
  • 基于CART的方法实现了2.2%的改进,p值为2.1×10⁻⁴,具有高度显著性。
  • 即使CRM方法可访问真实的倾向得分,其表现仍较差,原因在于策略空间过大,凸显了所提不确定性感知框架的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。