Skip to main content
QUICK REVIEW

[论文解读] Estimation of Optimal Dynamic Treatment Assignment Rules under Policy Constraints

Shosei Sakaguchi|arXiv (Cornell University)|Jun 9, 2021
Advanced Causal Inference Techniques被引用 4
一句话总结

本文提出了一种动态经验福利最大化(DEWM)框架,用于在实验或准实验研究的面板数据中,基于政策约束估计最优动态治疗规则。该框架引入了两种估计方法——向后推导与联合优化,实现了 $n^{-1/2}$-极小极大收敛速率和有限样本福利遗憾边界,并进一步扩展以处理跨期预算与容量约束。

ABSTRACT

Many policies involve dynamics in their treatment assignments, where individuals receive sequential interventions over multiple stages. We study estimation of an optimal dynamic treatment regime that guides the optimal treatment assignment for each individual at each stage based on their history. We propose an empirical welfare maximization approach in this dynamic framework, which estimates the optimal dynamic treatment regime using data from an experimental or quasi-experimental study while satisfying exogenous constraints on policies. The paper proposes two estimation methods: one solves the treatment assignment problem sequentially through backward induction, and the other solves the entire problem simultaneously across all stages. We establish finite-sample upper bounds on worst-case average welfare regrets for these methods and show their optimal $n^{-1/2}$ convergence rates. We also modify the simultaneous estimation method to accommodate intertemporal budget/capacity constraints.

研究动机与目标

  • 开发一种统计框架,用于在序列决策场景中估计最优动态治疗分配规则。
  • 解决在动态环境中,异质性治疗效应依赖于过去治疗、结果和协变量的挑战。
  • 将外生政策约束(如可解释性、公平性或预算限制)整合到动态治疗制度的估计中。
  • 为所提出的估计方法建立有限样本福利遗憾边界和极小极大收敛速率。
  • 将经验福利最大化(EWM)方法扩展至具有面板数据的动态、多阶段治疗问题。

提出的方法

  • 采用动态经验福利最大化(DEWM)方法,在预设的可行动态治疗规则(DTR)类上最大化经验福利。
  • 提出两种估计策略:向后推导法,从最终阶段到初始阶段逐阶段求解治疗选择问题;联合优化法,一次性求解所有阶段的完整 DTR 估计问题。
  • 在经验福利目标中使用倾向得分加权结果,以考虑实验和观察性数据中的治疗分配机制。
  • 将 DTR 估计问题表示为混合整数线性规划(MILP),在满足线性资格规则约束下,可通过标准优化求解器进行计算。
  • 通过向 MILP 公式中添加线性约束,将政策约束(如开始/停止时间或一次性治疗规则)纳入其中。
  • 通过在 MILP 中增加额外的线性约束,将联合 DEWM 方法扩展至包含跨期预算或容量约束,确保资源限制得到遵守。

实验结果

研究问题

  • RQ1在具有序列性、异质性治疗效应和可观测协变量的设定中,如何估计最优动态治疗规则?
  • RQ2在政策约束下,动态治疗规则估计的有限样本性能保证是什么?特别是福利遗憾边界如何?
  • RQ3在统计效率和计算可行性方面,向后推导法与联合优化法有何比较?
  • RQ4DEWM 框架能否适应现实世界中的政策约束,如预算限制或治疗持续时间限制?
  • RQ5在标准正则条件下,所提出估计器的极小极大收敛速率是多少?

主要发现

  • 所提出的 DEWM 方法实现了 $n^{-1/2}$-极小极大收敛速率,表明在标准正则条件下具有最优统计效率。
  • 推导出最坏情况下平均福利遗憾的有限样本上界,为估计的 DTR 性能提供了理论保证。
  • 向后推导法提供了递归求解路径,能够考虑未来治疗效应,从而提升长期福利优化效果。
  • 联合估计方法实现了所有阶段的联合优化,能够捕捉不同时间点治疗决策之间的复杂交互作用。
  • MILP 公式使得在各种政策约束(包括开始/停止时间与一次性治疗规则)下,高效计算最优 DTR 成为可能。
  • 通过在 MILP 中增加额外的线性约束,将预算或容量约束纳入联合 DEWM 框架,同时保持计算可处理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。