Skip to main content
QUICK REVIEW

[论文解读] Canonical Correlation Analysis for Analyzing Sequences of Medical Billing Codes

Corinne L. Jones, Sham M. Kakade|arXiv (Cornell University)|Dec 1, 2016
Diverticular Disease and Complications参考文献 9被引用 4
一句话总结

本文提出使用典型相关性分析(CCA)从医疗账单代码序列中生成低维、有意义的特征,捕捉诊断、操作和药物之间的关系。在憩室炎患者中的应用表明,CCA生成的特征在预测未来择期手术方面优于独热编码和二元组特征,尤其在惩罚逻辑回归中表现更优,且训练速度更快,各类模型的AUC得分具有竞争力。

ABSTRACT

We propose using canonical correlation analysis (CCA) to generate features from sequences of medical billing codes. Applying this novel use of CCA to a database of medical billing codes for patients with diverticulitis, we first demonstrate that the CCA embeddings capture meaningful relationships among the codes. We then generate features from these embeddings and establish their usefulness in predicting future elective surgery for diverticulitis, an important marker in efforts for reducing costs in healthcare.

研究动机与目标

  • 为解决医疗索赔数据机器学习中的特征生成挑战,其中独热编码无法捕捉账单代码之间的关系。
  • 探讨CCA是否能有效建模医疗账单代码序列中的潜在关系,类似于自然语言处理中词嵌入对词-上下文关系的建模。
  • 评估CCA衍生特征在预测临床相关结果(特别是憩室炎患者的择期手术)中的实用性。
  • 在下游预测建模中,比较CCA特征与标准的单字和二元组特征的性能。
  • 证明CCA特征可在显著降低维度的同时实现高预测性能,并大幅缩短训练时间。

提出的方法

  • 将每个医疗账单代码视为句子中的一个词,其上下文由滑动窗口大小ρ内的相邻代码定义。
  • 对两种视图应用典型相关性分析(CCA):代码本身(X)及其邻近代码(Y),以最大化其线性投影之间的相关性。
  • 使用带Tikhonov正则化的经验协方差矩阵估计CCA变换矩阵A和B,以处理稀疏且不常见的代码。
  • 利用学习到的A和B矩阵将每个代码投影到25维嵌入空间,然后在初始诊断前后的时间窗口内对嵌入进行平均。
  • 将平均后的CCA嵌入作为机器学习模型的输入特征,在训练前进行标准化处理。
  • 在AUC指标上,通过交叉验证和超参数调优,比较梯度提升、L2正则化逻辑回归和随机森林模型的性能。

实验结果

研究问题

  • RQ1典型相关性分析能否有效建模医疗账单代码序列之间的关系,类似于其在自然语言处理中对词-上下文关系的建模?
  • RQ2CCA衍生特征是否捕捉到了医疗索赔数据中具有临床意义的模式,表现为与语义相关代码的接近性?
  • RQ3CCA特征在预测憩室炎患者择期手术方面,与单字和二元组特征相比表现如何?
  • RQ4CCA特征是否能在显著降低特征维度的同时实现高预测性能,并大幅缩短训练时间?
  • RQ5在对高维输入敏感的模型(如惩罚逻辑回归)中,引入CCA特征是否能提升性能?

主要发现

  • CCA嵌入成功捕捉了医疗账单代码之间的有意义关系,表现为嵌入空间中最近邻反映临床合理性(例如,相关诊断和药物)。
  • 在惩罚逻辑回归中,CCA特征的AUC达到0.74(±0.03),显著优于单字特征(0.58)和单字+二元组特征(0.56)。
  • 在梯度提升模型中,CCA特征的AUC为0.74(±0.04),与最佳性能特征集(单字+二元组,AUC为0.76)处于一个标准差范围内。
  • 所有模型中,CCA特征(50维)的训练时间显著快于单字特征(20,000维)和单字+二元组特征(240,000维)。
  • 多层感知机基线模型表现中等,CCA特征的AUC为0.74,略优于单字特征(0.71)和单字+二元组特征(0.70)。
  • 结果表明,CCA特征是传统特征工程在索赔数据中的强大且高效替代方案,尤其适用于对输入维度敏感的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。