Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Representation Learning on Electronic Health Records with Graph Kernel Infomax

Hao-Ren Yao, Nairen Cao|arXiv (Cornell University)|Sep 1, 2022
Machine Learning in Healthcare参考文献 45被引用数 4
ひとこと要約

本稿では、電子歴史記録(EHR)の自己教師付き対照的学習のための、グラフ構造を変更せずに幾何学的に異なる視点を生成するカーネルに基づく部分空間増幅を用いる自己教師付き対照的学習手法であるGraph Kernel Infomax(GKI)を提案する。本手法は、臨床分野の下流タスクで最先端の性能を達成し、タスク固有の微調整なしに非臨床的グラフベンチマークに対しても一般化性と転送性を示す。

ABSTRACT

Learning Electronic Health Records (EHRs) representation is a preeminent yet under-discovered research topic. It benefits various clinical decision support applications, e.g., medication outcome prediction or patient similarity search. Current approaches focus on task-specific label supervision on vectorized sequential EHR, which is not applicable to large-scale unsupervised scenarios. Recently, contrastive learning shows great success on self-supervised representation learning problems. However, complex temporality often degrades the performance. We propose Graph Kernel Infomax, a self-supervised graph kernel learning approach on the graphical representation of EHR, to overcome the previous problems. Unlike the state-of-the-art, we do not change the graph structure to construct augmented views. Instead, we use Kernel Subspace Augmentation to embed nodes into two geometrically different manifold views. The entire framework is trained by contrasting nodes and graph representations on those two manifold views through the commonly used contrastive objectives. Empirically, using publicly available benchmark EHR datasets, our approach yields performance on clinical downstream tasks that exceeds the state-of-the-art. Theoretically, the variation on distance metrics naturally creates different views as data augmentation without changing graph structures.

研究の動機と目的

  • 複雑な時間的性質とラベルの欠如による、EHRにおける自己教師付きで汎用性のある患者表現学習の課題に対処すること。
  • 長期間にわたる高分散性のEHRシーケンスにおけるデータ増幅に起因する視点の曖昧性を克服すること。
  • グラフトポロジーを変更せずに、増幅中に意味的構造を保持する手法の開発。
  • タスク固有の微調整なしに、多様な臨床タスクに適用可能な普遍的で転送可能な患者表現を実現すること。
  • 標準的なグラフベンチマークデータセットを用いて、臨床分野を超えた一般化性を検証すること。

提案手法

  • 異なるカーネル誘導距離尺度を用いて、ノードおよびグラフを2つの幾何学的に異なる多様体に埋め込むためのカーネル部分空間増幅を提案する。
  • グラフカーネル手法を用いて、EHRの多様性と時間的ダイナミクスを構造的なグラフィカル表現に圧縮する。
  • 2つのカーネル誘導多様体視点間のノードおよびグラフ表現間の相互情報量を最大化することで、対照的学習を適用する。
  • 構造的摂動を避けるために、2つの異なる幾何学的空間におけるノードおよびグラフ埋め込みを比較する対照的目的関数を採用する。
  • 増幅プロセスにおいて疑似逆行列の計算に特徴値分解(SVD)を用いるが、アブレーションではSVDの適用が性能を低下させることを示している。
  • 部分空間クラスタリングのためのパラメトリックランドマーク選択(K)を採用し、感度分析によりK値の変動に対しても安定した性能を示している。

実験結果

リサーチクエスチョン

  • RQ1カーネルに基づく幾何的増幅は、EHR表現学習における構造的データ増幅を上回る性能を発揮するか?
  • RQ2データ増幅においてグラフトポロジーの変更を回避することで、長期間で複雑なEHRシーケンスにおける視点の曖昧性は軽減されるか?
  • RQ3タスク固有の監視なしに、自己教師付き手法が多様な臨床下流タスクで最先端の性能を達成できるか?
  • RQ4提案手法は非臨床的グラフベンチマークデータセットに対しても一般化性を示すか?
  • RQ5SVDおよび疑似逆行列計算は、対照的フレームワークの学習ダイナミクスと性能にどのような影響を及えるか?

主な発見

  • GKIは、治療結果予測や患者類似性検索を含む臨床下流タスクで、タスク固有の微調整なしに最先端の性能を達成した。
  • MIMIC-IIIベンチマークにおいて、GKIはInfoGraph や SimCLR を含む既存の対照的学習および自己教師付き手法をMacro-F1およびPrecision@10スコアの両面で上回った。
  • 非臨床的グラフベンチマークに対しても良好な一般化性能を示し、8つの標準データセットのうち6つで最先端のグラフ対照的学習手法を上回った。
  • ランドマーク数Kの増加に伴い性能が向上するが、低K値でも安定しており、ハイパーパrameter選択に対するロバストネスを示している。
  • アブレーションでは、訓練中にSVDを適用すると性能が低下することが判明し、SVDが特異値をゼロにすることで学習信号に干渉している可能性を示唆している。
  • GNNエンコーダーの種類に関わらず、強い性能を維持しており、GATは治療予測タスクで優れた結果を示した。これは、アテンション機構が複雑な関係を捉えられることに起因すると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。