Skip to main content
QUICK REVIEW

[論文レビュー] Temporal-Clustering Invariance in Irregular Healthcare Time Series

Mohammad Taha Bahadori, Zachary C. Lipton|arXiv (Cornell University)|Apr 27, 2019
Machine Learning in Healthcare参考文献 45被引用数 14
ひとこと要約

本稿では、不規則な医療タイムシリーズにおける正則化のための時間的クラスタリング不変性を提案し、近接するイベントを高い確率でマージすることで、タイムシリーズを粗くする確率的データ拡張法を導入している。マルチリゾリューションアンサンブル(MRE)モデルは、複数の粗くされたリゾリューションにおける予測をアンサンブルすることで、MIMIC-IIIで53.92%のmAPを達成し、ベースライン比2.39ポイントの向上を達成した。

ABSTRACT

Electronic records contain sequences of events, some of which take place all at once in a single visit, and others that are dispersed over multiple visits, each with a different timestamp. We postulate that fine temporal detail, e.g., whether a series of blood tests are completed at once or in rapid succession should not alter predictions based on this data. Motivated by this intuition, we propose models for analyzing sequences of multivariate clinical time series data that are invariant to this temporal clustering. We propose an efficient data augmentation technique that exploits the postulated temporal-clustering invariance to regularize deep neural networks optimized for several clinical prediction tasks. We introduce two techniques to temporally coarsen (downsample) irregular time series: (i) grouping the data points based on regularly-spaced timestamps; and (ii) clustering them, yielding irregularly-paced timestamps. Moreover, we propose a MultiResolution Ensemble (MRE) model, improving predictive accuracy by ensembling predictions based on inputs sequences transformed by different coarsening operators. Our experiments show that MRE improves the mAP on the benchmark mortality prediction task from 51.53% to 53.92%.

研究の動機と目的

  • 時間的クラスタリング不変性が不規則な臨床タイムシリーズデータに存在するかどうかを調査すること。
  • この不変性を活用するデータ拡張技術を開発し、ディープラーニングモデルの正則化を図ること。
  • マルチリゾリューションアンサンブルを用いて、臨床タイムシリーズタスクにおけるモデルの頑健性と予測精度を向上させること。
  • 医療データ収集実務のばらつきに起因する一貫性のない時間的クラスタリングの課題に対処すること。

提案手法

  • 隣接するイベントを確率的にマージする確率的粗化演算子を提案し、時間的に近いイベントほど高い確率でマージされるように設計している。
  • イベントを不規則間隔のクラスタにグループ化し、値を平均化する決定的クラスタ&カウント演算子を導入し、クラスタサイズを特徴量として付加している。
  • 同じ入力を複数の粗化演算子を通じて処理し、アテンションを用いて予測をアンサンブルするマルチリゾリューションアンサンブル(MRE)モデルを開発している。
  • すべてのリゾリューションで同じニューラルネットワークアーキテクチャを用い、パラメータ増加を抑えるために重みを共有している。
  • 粗化演算子をデータ前処理段階で適用し、クラスタを保持することで学習を高速化している。
  • 推論時において、複数のリゾリューションからの予測をアテンションベースの平均化により統合している。

実験結果

リサーチクエスチョン

  • RQ1多変量臨床タイムシリーズにおいて、時間的にイベントがクラスタリングされているか分散しているかに関わらず予測が安定する、時間的クラスタリング不変性が存在するか?
  • RQ2時間的粗化に基づくデータ拡張が、臨床予測向けディープラーニングモデルの一般化性能と頑健性を向上させられるか?
  • RQ3粗化されたタイムシリーズの複数リゾリューションにおける予測をアンサンブルすることで、予測精度が向上するか?
  • RQ4本手法は、データ分布のシフトや悪意のある摂動に対して、標準ベースラインと比較してどの程度頑健性を示すか?

主な発見

  • マルチリゾリューションアンサンブル(MRE)モデルは、MIMIC-IIIベンチマークにおいて死亡予測タスクの平均平均精度(mAP)を51.53%から53.92%に向上させた。
  • 提案されたデータ拡張技術は、悪意のある摂動に対するモデルの頑健性を向上させるとともに、過学習を低減した。
  • GRUを弱学習器とするMRE-Gridモデルは、個々の弱学習器よりも1トレーニングイテレーションあたりの収束が速かった。
  • MREモデルは、長期間滞在(LoS)予測タスクにおいても、先行研究より低いMAEおよびRMSEを達成したが、データセット前処理バイアスに敏感であることが判明した。
  • 粗化演算子は、微小な測定誤差や時間のジターリングに対してもある程度不変性を提供し、時間変形不変性と同様の性質を示した。
  • 粗化は事前に計算・保存されるため、計算コストが低く、トレーニングのオーバーヘッドも最小限に抑えられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。