Skip to main content
QUICK REVIEW

[論文レビュー] Synthetic Event Time Series Health Data Generation

Saloni Dash, Ritik Dutta|arXiv (Cornell University)|Nov 14, 2019
Machine Learning in Healthcare参考文献 13被引用数 8
ひとこと要約

本稿では、患者単位の睡眠イベントデータを時系列に沿った時間帯別特徴に変換し、その後に生成対抗ネットワーク(GAN)を用いて、時間的パターンと共変量の分布を保持する、合成の縦断的健康データを生成する新規手法を提案する。この手法は、時間的パターンと共変量の分布を保持しており、一変量および共変量の類似性が顕著であるが、特に若年層のような高分散サブグループでは分散を低く見積もっている。

ABSTRACT

Synthetic medical data which preserves privacy while maintaining utility can be used as an alternative to real medical data, which has privacy costs and resource constraints associated with it. At present, most models focus on generating cross-sectional health data which is not necessarily representative of real data. In reality, medical data is longitudinal in nature, with a single patient having multiple health events, non-uniformly distributed throughout their lifetime. These events are influenced by patient covariates such as comorbidities, age group, gender etc. as well as external temporal effects (e.g. flu season). While there exist seminal methods to model time series data, it becomes increasingly challenging to extend these methods to medical event time series data. Due to the complexity of the real data, in which each patient visit is an event, we transform the data by using summary statistics to characterize the events for a fixed set of time intervals, to facilitate analysis and interpretability. We then train a generative adversarial network to generate synthetic data. We demonstrate this approach by generating human sleep patterns, from a publicly available dataset. We empirically evaluate the generated data and show close univariate resemblance between synthetic and real data. However, we also demonstrate how stratification by covariates is required to gain a deeper understanding of synthetic data quality.

研究の動機と目的

  • 時間的イベントパターンと患者の共変量を捉えた合成の縦断的健康データの不足に対処すること。
  • 本物の患者記録に依存せず、プライバシーを保護し、利用価値を維持する合成医療時系列データ生成手法を開発すること。
  • 最小限のドメイン知識で再現可能でスケーラブルかつコストフリーな研究を可能にする、合成EHRに類似したデータの使用を可能とすること。
  • 平均統計を超えた、特に年齢や週の曜日といった重要な共変量を対象とした、合成データ品質の実証的評価を行うこと。
  • 共変量ごとの層別分析が、合成健康データの真の利用価値を評価するために不可欠であることを示すこと。

提案手法

  • 睡眠開始・終了時刻などのイベントレベルのデータを、固定時間間隔の要約(例:1時間あたりの睡眠時間)に変換し、断面的特徴を生成する。
  • 全員の時間的整合性を統一するため、30時間の日単位ウィンドウ(翌日の10:00 AMまで含む4:00 AMから)を用いる。
  • 1時間ごとの睡眠時間の集計を、1人の患者の1日分の睡眠パターンを表す30の特徴にまとめる。
  • 時間帯別睡眠特徴に、患者レベルの共変量(年齢層、性別、週の曜日、月)を追加する。
  • 変換された断面的データを学習データとして、生成対抗ネットワーク(GAN)を訓練し、合成患者記録を生成する。
  • 合成データの評価には、一変量統計、共変量確率一致、および年齢と週の曜日による層別分析を用いる。

実験結果

リサーチクエスチョン

  • RQ1合成データ生成手法は、不規則に発生する医療イベントを効果的にモデル化しつつ、時間的および共変量の依存関係を保持できるか?
  • RQ2GANで生成された合成データは、1時間ごとの平均睡眠時間という観点で、現実の睡眠パターンとどの程度類似しているか?
  • RQ3合成データは、年齢、性別、週の曜日といった患者共変量の同時分布をどの程度適切に捉えているか?
  • RQ4合成データは、年齢層や週の曜日ごとの睡眠時間の傾向を意味的に保持しているか?
  • RQ5特に不規則な睡眠パターンを示す高分散サブグループ(例:若年層)をモデル化する際、このモデルはどの程度の性能を示すか?

主な発見

  • 合成データは、1時間ごとの平均睡眠時間において、実データとほとんど差がないほど類似しており、すべての時間帯で最小限のずれを示している。
  • 合成データの共変量確率(例:実データの49%と比較して48%の平日)は、対角線に近く、周辺分布の一致が顕著であることを示している。
  • モデルは一般的な傾向をうまく捉えている:若年層(15–24歳)は他の年齢層よりも睡眠時間が長く、特に週末に顕著である。また、高齢者の方が中年層よりも睡眠時間が長い傾向にある。
  • しかし、合成データは特に週末の若年層の平均睡眠時間を低く見積もっており、高分散サブグループのモデル化に限界があることを示している。
  • 分位数分析により、15–24歳の若年層における睡眠タイミングの高分散性が合成データで捉えられていないことが判明した。実データに比べ、四分位範囲が狭くなっている。
  • 本研究では、合成データの評価を平均的行動に限定するのは不十分であり、特に重要な共変量による層別分析が、利用価値と品質の評価に不可欠であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。