[论文解读] Synthetic Event Time Series Health Data Generation
本文提出了一种新颖的方法,通过将患者级别的睡眠事件数据转换为横截面时间分箱特征,再训练生成对抗网络(GAN)来生成逼真的合成纵向健康数据。该方法保留了时间模式和协变量分布,表现出较强的单变量和协变量相似性,尽管在高方差亚群(如青少年)中低估了方差。
Synthetic medical data which preserves privacy while maintaining utility can be used as an alternative to real medical data, which has privacy costs and resource constraints associated with it. At present, most models focus on generating cross-sectional health data which is not necessarily representative of real data. In reality, medical data is longitudinal in nature, with a single patient having multiple health events, non-uniformly distributed throughout their lifetime. These events are influenced by patient covariates such as comorbidities, age group, gender etc. as well as external temporal effects (e.g. flu season). While there exist seminal methods to model time series data, it becomes increasingly challenging to extend these methods to medical event time series data. Due to the complexity of the real data, in which each patient visit is an event, we transform the data by using summary statistics to characterize the events for a fixed set of time intervals, to facilitate analysis and interpretability. We then train a generative adversarial network to generate synthetic data. We demonstrate this approach by generating human sleep patterns, from a publicly available dataset. We empirically evaluate the generated data and show close univariate resemblance between synthetic and real data. However, we also demonstrate how stratification by covariates is required to gain a deeper understanding of synthetic data quality.
研究动机与目标
- 解决缺乏能够捕捉时间事件模式和患者协变量的合成纵向健康数据的问题。
- 开发一种保护隐私且保持实用性的方法,无需依赖真实患者记录即可生成合成医疗时间序列数据。
- 实现无需领域知识的可重现、可扩展且成本低廉的研究,使用合成电子健康记录(EHR)类数据。
- 在平均统计量之外,实证评估合成数据质量,特别是针对年龄和星期几等关键协变量。
- 证明按协变量分层分析对于评估合成健康数据真实效用至关重要。
提出的方法
- 将原始事件级数据(如睡眠开始/结束时间)转换为固定时间间隔的汇总(如每小时睡眠时长),以生成横截面特征。
- 使用30小时的时间窗口(从凌晨4:00到次日早上10:00)对齐个体间的时间,实现标准化。
- 将每小时的睡眠时长汇总为30个特征,代表单个患者的每日睡眠模式。
- 在时间分箱的睡眠特征后附加患者级别的协变量(年龄组、性别、星期几、月份)。
- 在转换后的横截面数据上训练生成对抗网络(GAN),以生成合成患者记录。
- 通过单变量统计、协变量概率匹配以及按年龄和星期几的分层分析来评估合成数据。
实验结果
研究问题
- RQ1合成数据生成方法能否有效建模不规则分布的医疗事件,同时保留时间依赖性和协变量依赖性?
- RQ2GAN生成的合成数据在每小时平均睡眠时长方面与真实世界睡眠模式的相似程度如何?
- RQ3合成数据在多大程度上捕捉了患者协变量(如年龄、性别和星期几)的联合分布?
- RQ4合成数据是否保留了不同年龄组和星期几之间睡眠时长的有意义趋势?
- RQ5该模型在捕捉高方差亚群(如睡眠模式不规律的青少年)方面表现如何?
主要发现
- 合成数据在每小时平均睡眠时长方面与真实数据高度一致,所有时间区间的偏差极小。
- 合成数据中的协变量概率(如48%的工作日 vs. 真实数据中的49%)紧密分布在对角线上,表明边缘分布匹配良好。
- 该模型成功捕捉了总体趋势:青少年(15–24岁)的睡眠时间多于其他年龄组,尤其在周末;老年人的睡眠时间多于中年人。
- 然而,合成数据低估了青少年(特别是周末)的平均睡眠时间,表明在建模高方差亚群方面存在局限性。
- 分位数分析显示,与真实数据相比,合成数据未能捕捉15–24岁人群在睡眠时间上的高方差,表现为四分位距更窄。
- 本研究表明,仅通过平均行为评估合成数据是不够的;按关键协变量分层分析对于评估其效用和质量至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。