Skip to main content
QUICK REVIEW

[論文レビュー] Prediction-Constrained Topic Models for Antidepressant Recommendation

Michael C. Hughes, Gabriel Hope|arXiv (Cornell University)|Dec 1, 2017
Topic Modeling参考文献 16被引用数 5
ひとこと要約

本稿では、電子歴史記録(EHR)データの生成的モデリングと治療結果の正確な予測の両方をバランスさせるように最適化することで、抗うつ薬の推薦を向上させる予測制約型(PC)トピックモデルを提案する。従来の教師ありトピックモデルとは異なり、データとラベルの尤度が混同されるのを避けるために、PC-sLDAはラベル予測の最適化を明示的に行いながら、解釈可能なトピック-語分布を維持する。その結果、予測AUCと生成的尤度の両面でベースラインモデルを上回る優れた性能を達成した。

ABSTRACT

Supervisory signals can help topic models discover low-dimensional data representations that are more interpretable for clinical tasks. We propose a framework for training supervised latent Dirichlet allocation that balances two goals: faithful generative explanations of high-dimensional data and accurate prediction of associated class labels. Existing approaches fail to balance these goals by not properly handling a fundamental asymmetry: the intended task is always predicting labels from data, not data from labels. Our new prediction-constrained objective trains models that predict labels from heldout data well while also producing good generative likelihoods and interpretable topic-word parameters. In a case study on predicting depression medications from electronic health records, we demonstrate improved recommendations compared to previous supervised topic models and high- dimensional logistic regression from words alone.

研究の動機と目的

  • 高次元のEHRデータに起因する生成的尤度がラベル予測を上回るという、教師ありトピックモデルにおける不均衡を是正すること。
  • 予測タスクの根本的な非対称性を是正すること:ラベルをデータから予測するのではなく、データをラベルから予測するのではなく。
  • 高品質なトピック-語分布を維持しながら、下流のラベル予測精度を向上させる訓練目的を構築すること。
  • PC-sLDAが、既存の教師ありトピックモデルおよび高次元のロジスティック回帰を上回り、EHRから抗うつ薬の成功を予測できるかどうかを実証すること。

提案手法

  • 観測された語の尤度と、保留データにおける予測性能の最適化を明示的に行う予測制約型(PC)目的関数を導入する。この目的関数は、語数の生成的モデリングを維持する。
  • 観測された語の尤度とラベル予測の正確性の両方をバランスさせるハイブリッド目的関数を用いてトピックモデルを訓練する。制約付き最適化フレームワークを用いる。
  • ドキュメント-トピック分布の事後分布を近似するために変分推論を用い、トピックが予測的有用性と整合するように正則化を施す。
  • 収束性と解釈可能性を向上させるために、Gibbs-LDAからの初期化を実施し、トピックの進化を直接比較可能にする。
  • 5,126語のコード語と11種の抗うつ薬を含む、匿名化されたEHRデータを用いて、多ラベル抗うつ薬推薦タスクにPC目的関数を適用する。
  • 保留された負の対数尤度(生成的)とAUC(識別的)を用いて性能を評価し、sLDA、Gibbs-LDA、およびロジスティック回帰と比較する。

実験結果

リサーチクエスチョン

  • RQ1モデルの誤指定が生じる中でも、EHRデータの説明と抗うつ薬の結果予測の両方を同時にうまく行える教師ありトピックモデルを訓練できるか?
  • RQ2sLDAにおける尤度の同時最大化とは対照的に、明示的な予測性能制約が、ラベル予測の精度を向上させるか?
  • RQ3PC-sLDAが学習するトピック-語分布は、非教師ありLDAのものと比べて、臨床的解釈可能性と予測力の面でどのように異なるか?
  • RQ4EHRからの語数のみを用いて、PC-sLDAが高次元のロジスティック回帰を上回る性能を示せるか?
  • RQ5トピック数を増加させた場合、PC目的関数は、BP-sLDAのような他の教師ありモデルと比較して過学習を防げるか?

主な発見

  • 十分なトピック数が使用された場合、PC-sLDAは11種の抗うつ薬すべてにおいて、Gibbs-LDAおよびロジスティック回帰を上回る保留AUC(識別的性能)を達成した。
  • PC-sLDAは、BP-sLDAよりも優れた保留負の対数尤度を維持しており、EHR語数の生成的モデリングが優れていることを示している。
  • PC-sLDAが学習するトピック-語分布は、より解釈可能で臨床的に関連性が高く、一般予防ケアからカウンセリング関連語に段階的に進化している。
  • Gibbs-LDAからの初期化により、PC-sLDAはトピック構造に顕著な進化を示しており、1つのトピックが定期的な予防接種から行動変容に焦点を当てた長期的な一次ケア訪問に移行した。
  • BP-sLDAはトピック数の増加に伴い深刻な過学習を示し、PC-sLDAよりも尤度と性能が劣っていた。
  • PC-sLDAは両方の目的をうまくバランスしており、EHRデータの説明が優れており、従来の教師ありトピックモデルを上回る抗うつ薬の成功予測精度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。