[论文解读] Quality control, data cleaning, imputation
本文为真实世界数据(RWD)中的质量控制、数据清洗和填补提供了全面指南,强调在最小化偏差的前提下处理缺失数据的方法。它评估了统计与机器学习填补技术,突出显示了信息性缺失和重复观测等挑战,并提出了填补的替代方案,为研究人员在RWD研究中进行稳健数据分析提供了实用且基于证据的策略。
This chapter addresses important steps during the quality assurance and control of RWD, with particular emphasis on the identification and handling of missing values. A gentle introduction is provided on common statistical and machine learning methods for imputation. We discuss the main strengths and weaknesses of each method, and compare their performance in a literature review. We motivate why the imputation of RWD may require additional efforts to avoid bias, and highlight recent advances that account for informative missingness and repeated observations. Finally, we introduce alternative methods to address incomplete data without the need for imputation.
研究动机与目标
- 解决真实世界数据(RWD)质量保证与控制中的关键挑战,特别是与缺失数据相关的问题。
- 评估并比较用于填补RWD中缺失值的统计与机器学习方法。
- 突出显示由于信息性缺失和重复观测导致RWD填补中偏差风险的问题。
- 提出避免对缺失数据机制做假设的填补替代方法。
- 支持研究人员在RWD研究中选择合适且稳健的数据预处理方法。
提出的方法
- 本文提出了一套结构化的RWD质量控制与数据清洗框架,重点在于识别和解决数据质量问题。
- 回顾了常见的填补技术,包括广义加性模型链式方程多重填补(MICE)、回归填补,以及基于机器学习的方法(如随机森林和k近邻)。
- 作者评估了每种方法的优势与劣势,尤其关注其假设、可扩展性以及在不同缺失数据机制下的表现。
- 本文强调了建模信息性缺失的重要性——即缺失与未观测值相关——并使用模式混合模型和选择模型等高级技术进行处理。
- 讨论了处理RWD中重复或聚类观测的方法,如混合效应模型和边际模型,以在填补过程中保持数据结构。
- 本文还提出了非填补替代方案,如完整案例分析结合敏感性分析和逆概率加权,以避免填补带来的潜在偏差。
实验结果
研究问题
- RQ1在具有复杂缺失数据机制的真实世界数据中,哪种填补方法最为有效?
- RQ2信息性缺失在多大程度上影响RWD中填补结果的有效性?如何正确建模?
- RQ3传统统计填补与现代机器学习填补在RWD中的性能权衡是什么?
- RQ4在数据清洗与填补过程中,如何适当地处理RWD中的重复或聚类观测?
- RQ5在何种情况下,非填补方法相较于填补更适合处理不完整的RWD?
主要发现
- 在可忽略缺失情况下,链式方程多重填补(MICE)和基于机器学习的填补(如随机森林)表现良好,但如果未正确建模信息性缺失,可能引入偏差。
- 明确建模缺失数据机制的方法(如模式混合模型)在信息性缺失存在时表现出更强的稳健性。
- RWD中的填补需要仔细考虑数据结构,包括重复测量和聚类,以避免违反独立性假设。
- 当填补假设存疑时,使用逆概率加权和完整案例分析结合敏感性分析可作为填补的可行替代方案。
- 尽管机器学习填补方法具有灵活性,但需要仔细验证,并对超参数调优和数据稀疏性敏感。
- 本文结论认为,没有一种填补方法在所有情况下均优于其他方法;方法选择应基于数据结构、缺失数据机制和研究目标进行指导。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。