Skip to main content
QUICK REVIEW

[論文レビュー] Supervised Laplacian Eigenmaps with Applications in Clinical Diagnostics for Pediatric Cardiology

Thomas Perry, Hongyuan Zha|arXiv (Cornell University)|Jul 27, 2012
Machine Learning in Healthcare参考文献 19被引用数 5
ひとこと要約

本稿では、電子歴史記録の臨床テキストを低次元空間に埋め込みながら、局所的な類似性を保持し、診断予測を最適化する新規手法である教師ありラプラシアン固有写像(SLE)を提案する。交互勾配降下を用いてテキスト埋め込みと分類器パラメータを同時に学習することで、SLEはLSI、LDA、LFDAを上回り、小児心疾患の予測においてAUC 0.782、MCC 0.374を達成した。非教師ありラプラシアン固有写像と比較して、AUCは2.69%、MCCは5.35%向上した。

ABSTRACT

Electronic health records contain rich textual data which possess critical predictive information for machine-learning based diagnostic aids. However many traditional machine learning methods fail to simultaneously integrate both vector space data and text. We present a supervised method using Laplacian eigenmaps to augment existing machine-learning methods with low-dimensional representations of textual predictors which preserve the local similarities. The proposed implementation performs alternating optimization using gradient descent. For the evaluation we applied our method to over 2,000 patient records from a large single-center pediatric cardiology practice to predict if patients were diagnosed with cardiac disease. Our method was compared with latent semantic indexing, latent Dirichlet allocation, and local Fisher discriminant analysis. The results were assessed using AUC, MCC, specificity, and sensitivity. Results indicate supervised Laplacian eigenmaps was the highest performing method in our study, achieving 0.782 and 0.374 for AUC and MCC respectively. SLE showed an increase in 8.16% in AUC and 20.6% in MCC over the baseline which excluded textual data and a 2.69% and 5.35% increase in AUC and MCC respectively over unsupervised Laplacian eigenmaps. This method allows many existing machine learning predictors to effectively and efficiently utilize the potential of textual predictors.

研究の動機と目的

  • 従来の機械学習モデルが、電子歴史記録における予測価値の高い非構造的臨床テキストを無視するという限界に対処するため。
  • 小児循環器学における診断性能を向上させるために、テキスト埋め込みと分類器パラメータを同時に最適化する手法を開発するため。
  • 局所的な意味的類似性を保持する統一的で低次元の表現に、テキスト予測子と数値ベクトルデータを統合するため。
  • 2,000件を超える患者記録を含む実世界の小児循環器学データセットを用いて、本手法の予測性能を従来の次元削減手法と比較評価するため。
  • 教師ありテキスト埋め込みが、非教師ありまたはベースライン手法を上回る診断精度の向上をもたらすことを実証するため。

提案手法

  • 本手法は、臨床ノート間の局所的類似性を保持する低次元ユークリッド空間に、テキスト予測子を埋め込むために教師ありラプラシアン固有写像を用いる。
  • 勾配降下を用いて、埋め込みと分類器パラメータを交互に最適化し、予測誤差と多様体正則化を含む損失関数を同時に最小化する。
  • 埋め込みは、テキストデータから導出された類似度行列を用いて構築され、ラプラシアン行列が局所的近傍構造を強制する。
  • 新しいテスト文書の埋め込みを推定するため、重み付きk近傍法を用いたアウトオブサンプル推論をサポートする。
  • 目的関数には、訓練データへの適合性と埋め込み空間内の滑らかさのトレードオフを調整するハイパーパrameter λ が含まれる。
  • 本手法は、数値的および埋め込み済みテキスト特徴を統合して心疾患状態を予測するため、ロジスティック回帰をベース分類器として用いる。

実験結果

リサーチクエスチョン

  • RQ1教師ありラプラシアン固有写像は、臨床ノートのテキストと数値データを効果的に統合し、小児循環器学における診断予測を改善できるか?
  • RQ2SLEの性能は、LSI、LDA、LFDAなどの非教師ありおよび教師ありベースラインと比較して、心疾患予測においてどのように異なるか?
  • RQ3テキスト埋め込みと分類器パラメータの共同最適化は、埋め込みと予測子を別々に訓練するのと比較して、より優れた一般化性能をもたらすか?
  • RQ4SLEは、新しい未観測臨床ノートの埋め込み推定という実用的制約下でも、どのように性能を発揮するか?
  • RQ5ハイパーパrameter λ は、SLEモデルの安定性と性能にどのような影響を及えるか?

主な発見

  • SLEはAUC 0.782、MCC 0.374を達成し、LSI、LDA、LFDAを含むすべてのベースライン手法をAUCおよびMCCの両指標で上回った。
  • SLEは、テキストデータを含まないベースラインモデルと比較して、AUCは8.16%、MCCは20.6%向上した。
  • 非教師ありラプラシアン固有写像と比較して、SLEはAUCを2.69%、MCCを5.35%向上させ、埋め込みプロセスにおける教師あり性の利点を示した。
  • 非常に低い次元(<17)ではLSIがSLEを上回ったが、SLEは新しいテストデータの埋め込み推定において、効率的なアウトオブサンプル推論のおかげでLSIを上回った。
  • 重み付きk近傍法によるアウトオブサンプル埋め込み推定は、最も類似した近傍に重点を置くため、標準的な平均化手法よりも顕著に優れた性能を示した。
  • 本手法はハイパーパrameter λ に敏感であるが、実際には段階的最適化戦略が最適性能を達成するのに有効であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。