[论文解读] Interactive Q-learning for Probabilities and Quantiles
本文提出了用于概率和分位数的交互式Q-learning(TIQ-learning和QIQ-learning),将Q-learning扩展至优化响应分布的非均值泛函——具体而言,即超过阈值的概率或预设分位数(如中位数)。该方法通过交互式建模条件期望,估计在两阶段序贯试验中最大化缓解概率或分位数的动态治疗方案,模拟和真实世界抑郁症治疗数据应用中表现优异。
A dynamic treatment regime is a sequence of decision rules in which each decision rule recommends treatment based on features of patient medical history such as past treatments and outcomes. Existing methods for estimating optimal dynamic treatment regimes from data optimize the mean of a response variable. However, the mean may not always be the most appropriate summary of performance. We derive estimators of decision rules for optimizing probabilities and quantiles computed with respect to the response distribution for two-stage, binary treatment settings. This enables estimation of dynamic treatment regimes that optimize the cumulative distribution function of the response at a prespecified point or a prespecified quantile of the response distribution such as the median. The proposed methods perform favorably in simulation experiments. We illustrate our approach with data from a sequentially randomized trial where the primary outcome is remission of depression symptoms.
研究动机与目标
- 解决现有动态治疗方案方法仅优化均值响应的局限性,该局限在偏态或非正态结果下可能不足。
- 开发一种框架,用于估计最优动态治疗方案,以最大化患者达到缓解(阈值超出)的概率或结果分布的特定分位数(如中位数)。
- 通过使用交互式回归模型对未来的结果条件分布进行建模,将Q-learning扩展至处理非均值泛函。
- 提供一种实用且可解释的方法,用于个性化医疗,尤其在临床目标更宜用概率或分位数而非期望值表示的场景中。
提出的方法
- 提出阈值交互式Q-learning(TIQ-learning),通过加权最小二乘估计值函数,估计使结果超过预设阈值的概率最大化的治疗方案。
- 引入分位数交互式Q-learning(QIQ-learning),通过建模未来结果的条件分位数,估计使响应分布的预设分位数最大化的治疗方案。
- 采用交互式建模方法,将未来最优结果的条件期望建模为第一阶段协变量和治疗的函数,对均值和方差分量分别建立回归模型。
- 采用两阶段估计程序:首先,通过建模给定第一阶段历史和治疗下结果的条件均值,估计最优第二阶段决策规则;其次,通过在估计的未来最优结果上进行类似Q-learning的回归,估计最优第一阶段规则。
- 应用增广逆概率加权法估计所得治疗方案的值,从而在缺失性和模型误设条件下实现有效推断。
- 在第一阶段使用未来最优结果条件期望的工件模型,对治疗和对照分别设置独立的参数向量,以允许异方差性和非单调效应。
实验结果
研究问题
- RQ1能否估计出优化结果分布非均值泛函(如缓解概率或中位数结果)的动态治疗方案?
- RQ2在两阶段序贯治疗设置中,如何将Q-learning扩展以处理阈值超出概率和分位数?
- RQ3与标准Q-learning相比,所提出的交互式Q-learning方法在优化概率和分位数时表现如何?
- RQ4在何种情况下,优化均值响应无法与临床有意义的目标对齐,而优化分位数或概率更为合适?
- RQ5所提出的方法能否应用于真实世界的序贯随机对照试验,如抑郁症治疗的STAR*D研究?
主要发现
- 所提出的TIQ-learning和QIQ-learning方法成功估计了优化缓解概率或结果分布预设分位数的动态治疗方案。
- 在模拟中,当目标为最大化分位数或阈值超出概率时,所提方法优于标准Q-learning,尤其在异方差误差结构下表现更优。
- 在STAR*D抑郁症试验中,TIQ-learning与标准Q-learning估计的治疗方案值几乎相同,表明在无异方差性时,均值优化可能已足够。
- 在第一阶段,二值化Q-learning与TIQ-learning为132名患者中的18名推荐了不同的治疗,但二值化Q-learning方案的估计值略低。
- 对所有患者采用相同治疗的非动态方案的值估计始终低于动态方案,证实了个性化治疗的优势。
- 在使用增广逆概率加权法时,方法对模型误设具有鲁棒性,并且在模拟设置中即使样本量适中也表现良好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。