Skip to main content
QUICK REVIEW

[论文解读] Development and Validation of ML-DQA -- a Machine Learning Data Quality Assurance Framework for Healthcare

Mark Sendak, Gaurav Sirdeshmukh|arXiv (Cornell University)|Aug 4, 2022
Electronic Health Records Systems被引用 8
一句话总结

本文提出了ML-DQA,一种机器学习数据质量保障框架,旨在对跨多种临床项目的现实世界医疗数据实施标准化和验证。该框架在涉及247,536名患者的五个跨国、多病症研究中得到应用,实现了统一的数据质量实践——如基于规则的自动化转换、统一的数据元素映射以及临床审核——共执行了2,999项质量检查并生成24份报告,平均每个项目有23.4个数据元素被转换或移除。

ABSTRACT

The approaches by which the machine learning and clinical research communities utilize real world data (RWD), including data captured in the electronic health record (EHR), vary dramatically. While clinical researchers cautiously use RWD for clinical investigations, ML for healthcare teams consume public datasets with minimal scrutiny to develop new algorithms. This study bridges this gap by developing and validating ML-DQA, a data quality assurance framework grounded in RWD best practices. The ML-DQA framework is applied to five ML projects across two geographies, different medical conditions, and different cohorts. A total of 2,999 quality checks and 24 quality reports were generated on RWD gathered on 247,536 patients across the five projects. Five generalizable practices emerge: all projects used a similar method to group redundant data element representations; all projects used automated utilities to build diagnosis and medication data elements; all projects used a common library of rules-based transformations; all projects used a unified approach to assign data quality checks to data elements; and all projects used a similar approach to clinical adjudication. An average of 5.8 individuals, including clinicians, data scientists, and trainees, were involved in implementing ML-DQA for each project and an average of 23.4 data elements per project were either transformed or removed in response to ML-DQA. This study demonstrates the importance role of ML-DQA in healthcare projects and provides teams a framework to conduct these essential activities.

研究动机与目标

  • 通过真实世界数据(RWD)解决临床研究人员与医疗领域机器学习团队之间数据质量实践不一致的问题。
  • 弥合临床研究人员对真实世界数据谨慎使用与公共数据集在机器学习模型开发中被轻率消费之间的差距。
  • 开发一个可扩展、可重用的框架,基于真实世界数据的最佳实践,确保各类医疗机器学习项目的数据质量。
  • 在多个项目、地理区域和医学条件下实现数据质量流程的标准化,以提升可重复性和可靠性。
  • 通过在五个不同机器学习项目中的实际应用,证明该框架的可行性与影响力。

提出的方法

  • 设计模块化框架ML-DQA,将标准化的数据质量检查整合到电子健康记录(EHR)中的数据元素中。
  • 实施通用的基于规则的转换库,以在各项目间统一标准化诊断和药物数据元素。
  • 基于临床和技术标准,建立将数据质量检查分配给特定数据元素的统一方法。
  • 采用一致的方法对涉及多学科团队(包括临床医生、数据科学家和学员)的数据质量问题进行临床审核。
  • 通过标准化映射策略对冗余的数据元素表示形式进行分组,以减少数据异质性。
  • 通过集成工具自动化数据质量报告生成,跨五个项目共生成24份质量报告。

实验结果

研究问题

  • RQ1标准化数据质量保障框架在使用真实世界数据的医疗机器学习项目中,如何提升一致性和可靠性?
  • RQ2统一框架在真实世界医疗环境中,对多种临床病症、地理区域和数据源的适用程度如何?
  • RQ3在多个机器学习项目中应用集中化数据质量框架时,哪些关键可复用实践会浮现出来?
  • RQ4让多学科团队(临床医生、数据科学家、学员)参与,如何影响数据质量保障的实施与效果?
  • RQ5在多个项目中使用ML-DQA,可在数据质量与转换方面实现哪些可衡量的改进?

主要发现

  • ML-DQA已成功应用于五个涉及247,536名患者、跨越两个地理区域并涵盖多种医学病症的机器学习项目中。
  • 共执行了2,999项数据质量检查,并生成24份质量报告,证明了系统性数据验证的实现。
  • 平均每个项目有23.4个数据元素因ML-DQA识别出的数据质量问题而被转换或移除。
  • 提炼出五项可推广的数据质量实践:标准化数据元素分组、自动化诊断/药物映射、共享的基于规则的转换库、统一的检查分配机制以及一致的临床审核流程。
  • 平均每个项目有5.8名人员参与ML-DQA的实施,包括临床医生、数据科学家和学员,表明跨学科协作程度高。
  • 该框架在异构项目中实现了稳定、可重复的数据质量实践,显著降低了数据不一致性,提升了模型可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。