[論文レビュー] Development and Validation of ML-DQA -- a Machine Learning Data Quality Assurance Framework for Healthcare
本稿では、多様な臨床プロジェクトにわたる現実世界の医療データを標準化・検証することを目的とした機械学習を用いたデータ品質保証フレームワーク、ML-DQAを紹介する。247,536名の患者を対象とした5つの多地域的・多疾患性研究に適用されたML-DQAにより、自動ルールベースの変換、統一されたデータ要素マッピング、臨床的仲裁といった一貫したデータ品質管理手法が実施され、合計2,999件の品質チェックと24通の報告書が作成され、プロジェクトあたり平均23.4のデータ要素が変換または削除された。
The approaches by which the machine learning and clinical research communities utilize real world data (RWD), including data captured in the electronic health record (EHR), vary dramatically. While clinical researchers cautiously use RWD for clinical investigations, ML for healthcare teams consume public datasets with minimal scrutiny to develop new algorithms. This study bridges this gap by developing and validating ML-DQA, a data quality assurance framework grounded in RWD best practices. The ML-DQA framework is applied to five ML projects across two geographies, different medical conditions, and different cohorts. A total of 2,999 quality checks and 24 quality reports were generated on RWD gathered on 247,536 patients across the five projects. Five generalizable practices emerge: all projects used a similar method to group redundant data element representations; all projects used automated utilities to build diagnosis and medication data elements; all projects used a common library of rules-based transformations; all projects used a unified approach to assign data quality checks to data elements; and all projects used a similar approach to clinical adjudication. An average of 5.8 individuals, including clinicians, data scientists, and trainees, were involved in implementing ML-DQA for each project and an average of 23.4 data elements per project were either transformed or removed in response to ML-DQA. This study demonstrates the importance role of ML-DQA in healthcare projects and provides teams a framework to conduct these essential activities.
研究の動機と目的
- 実世界の医療データ(RWD)を用いた臨床研究者と機械学習(ML)チーム間でのデータ品質管理の不一致を是正すること。
- 臨床的RWD使用における慎重さと、MLモデル開発における公的データセット利用における最小限の吟味のギャップを埋めること。
- 実世界の医療データ(RWD)のベストプラクティスに基づいた、スケーラブルで再利用可能なフレームワークを開発し、多様な医療MLプロジェクトにおけるデータ品質を保証すること。
- 複数のプロジェクト、地域、医学的疾患にわたるデータ品質プロセスを標準化し、再現性と信頼性を向上させること。
- 5つの異なるMLプロジェクトにおける実世界での実装を通じて、フレームワークの実現可能性と影響を示すこと。
提案手法
- 電子カルテ(EHR)のデータ要素にわたる標準化されたデータ品質チェックを統合したモジュール型フレームワーク、ML-DQAの設計。
- 複数のプロジェクトにわたる診断および薬剤データ要素の正規化を目的とした共通のルールベース変換ライブラリの実装。
- 臨床的および技術的基準に基づき、特定のデータ要素にデータ品質チェックを割り当てる統一された方法の確立。
- 臨床医、データサイエンティスト、およびトレーニーを含む多職種チームによるデータ品質問題の臨床的仲裁を一貫して実施。
- データの多様性を低減するため、標準化されたマッピング戦略を用いて重複するデータ要素表現をグループ化。
- 統合されたユーティリティを介してデータ品質レポートを自動化し、5つのプロジェクトにわたって24通の品質レポートを生成。
実験結果
リサーチクエスチョン
- RQ1標準化されたデータ品質保証フレームワークは、実世界の医療データを用いた医療MLプロジェクトにおける一貫性と信頼性をどのように向上させるか?
- RQ2多様な医学的疾患、地域、データソースを有する実世界の医療環境において、統一されたフレームワークをどの程度適用可能か?
- RQ3複数のMLプロジェクトにわたる集中型データ品質フレームワークの適用を通じて、どのような再利用可能な実践が浮き彫りになるか?
- RQ4臨床医、データサイエンティスト、トレーニーを含む多職種チームの関与は、データ品質保証の実装と効果性にどのように影響するか?
- RQ5ML-DQAを用いることで、複数のプロジェクトにわたってどの程度のデータ品質および変換の改善が達成できるか?
主な発見
- ML-DQAは、2か国にまたがり、複数の医学的疾患を対象とした5つのMLプロジェクトに成功裏に適用された。
- 合計2,999件のデータ品質チェックが実行され、24通の品質レポートが生成され、体系的なデータ検証が実証された。
- ML-DQAが特定したデータ品質問題に応じて、プロジェクトあたり平均23.4のデータ要素が変換または削除された。
- 5つの一般化可能なデータ品質実践が浮き彫りになった:標準化されたデータ要素グループ化、自動診断/薬剤マッピング、共有ルールベース変換ライブラリ、統一されたチェック割り当て、一貫した臨床的仲裁。
- ML-DQAの実装に平均5.8名(臨床医、データサイエンティスト、トレーニーを含む)がプロジェクトごとに関与しており、強力な多職種連携が実現された。
- フレームワークにより、多様性のあるプロジェクト間で一貫した、再現可能なデータ品質管理が可能となり、データの不一致が顕著に低減され、モデルの信頼性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。