[论文解读] Learning Optimal Personalized Treatment Rules Using Robust Regression Informed K-NN
本文提出了一种稳健且可解释的方法,通过结合正则化最小绝对偏差(RLAD)回归与K-最近邻(K-NN)进行结果预测,利用电子健康记录(EHRs)学习最优个性化治疗规则。该方法使用RLAD估计特征权重以构建稳健的距离度量,实现稳定的局部非线性预测,并应用一种随机预处理策略,使糖尿病患者的HbA1c降低和高血压患者的收缩压控制效果优于标准治疗。
We develop a prediction-based prescriptive model for learning optimal personalized treatments for patients based on their Electronic Health Records (EHRs). Our approach consists of: (i) predicting future outcomes under each possible therapy using a robustified nonlinear model, and (ii) adopting a randomized prescriptive policy determined by the predicted outcomes. We show theoretical results that guarantee the out-of-sample predictive power of the model, and prove the optimality of the randomized strategy in terms of the expected true future outcome. We apply the proposed methodology to develop optimal therapies for patients with type 2 diabetes or hypertension using EHRs from a major safety-net hospital in New England, and show that our algorithm leads to a larger reduction of the HbA1c, for diabetics, or systolic blood pressure, for patients with hypertension, compared to the alternatives. We demonstrate that our approach outperforms the standard of care under the robustified nonlinear predictive model.
研究动机与目标
- 解决在学习最优治疗规则时EHRs中的噪声、缺失数据和非线性问题。
- 开发一种计算高效且可解释的个性化医学方法,优于标准治疗。
- 确保对临床数据中的异常值和分布变化的鲁棒性。
- 为随机治疗策略的样本外性能和最优性提供理论保证。
- 使该方法适用于标准治疗未知或不明确的场景。
提出的方法
- 使用正则化LAD(RLAD)问题估计稳健的线性系数,通过最小化绝对偏差并防范异常值影响。
- 利用RLAD系数的平方作为权重,构建K-NN的加权距离度量,突出对结果最具预测力的特征。
- 通过在每个治疗组中对K个最近邻的结果取平均,预测每种治疗下的未来结果。
- 应用一种随机预处理策略,其中治疗概率与预测结果的指数倒数成正比,以促进探索并增强鲁棒性。
- 推导出治疗推荐的闭式阈值,相较于以往基于交叉验证的选择方法,提升了计算效率。
- 该方法在一家安全网医院的真实EHR数据上进行了验证,对象为2型糖尿病和高血压患者。
实验结果
研究问题
- RQ1基于RLAD和K-NN的稳健非参数方法是否能在个性化治疗推荐中优于标准预测和预处理模型?
- RQ2基于预测结果的随机策略是否能带来优于确定性策略的期望未来结果?
- RQ3所提出的方法如何处理现实世界EHR数据中的噪声、缺失数据和非线性问题?
- RQ4当标准治疗未知或可变时,该方法是否仍可适用?
- RQ5随机治疗规则的样本外性能和最优性有何理论保证?
主要发现
- 在糖尿病患者中,RLAD+K-NN模型在预测HbA1c方面取得了最高的R²(0.52)和最低的MSE(1.34),优于OLS、LASSO、Huber和单独的K-NN。
- 在高血压患者中,该模型实现了R²为0.36、MSE为159.74,显著优于Huber(R²为0.22)和CART(R²为0.25)。
- 与次优方法相比,该方法使糖尿病和高血压的平均绝对误差(MAE)分别降低了1%,中位数绝对误差(AE)改善分别为1%和2%。
- 在稳健预测模型下,随机策略带来的HbA1c和收缩压降低幅度大于标准治疗。
- 特征重要性分析显示,HbA1c、血糖和收缩压是糖尿病的主要预测因子,而收缩压、年龄和钠是高血压的关键预测因子。
- 治疗推荐的闭式阈值相较于以往基于交叉验证的选择方法,显著提升了计算效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。