Skip to main content
QUICK REVIEW

[論文レビュー] Supervised topic models for clinical interpretability

Michael C. Hughes, Huseyin Melih Elibol|arXiv (Cornell University)|Dec 6, 2016
Topic Modeling参考文献 10被引用数 7
ひとこと要約

本稿では、理想的なドキュメント埋め込み関数を用いてトレーニングと推論を整合させるようにすることで、臨床的解釈可能性と予測性能を向上させる、教師ありトピックモデルの罰則付きエンドツーエンド最適化フレームワークを提案する。認識ネットワークを組み込むことで、ラベル信号が弱い状況下でも、標準的なsLDAに比べて高速なトレーニングとより良い一般化性能を達成でき、抗うつ薬治療成功を予測する大規模なEHRデータセットで実証された。

ABSTRACT

Supervised topic models can help clinical researchers find interpretable cooccurence patterns in count data that are relevant for diagnostics. However, standard formulations of supervised Latent Dirichlet Allocation have two problems. First, when documents have many more words than labels, the influence of the labels will be negligible. Second, due to conditional independence assumptions in the graphical model the impact of supervised labels on the learned topic-word probabilities is often minimal, leading to poor predictions on heldout data. We investigate penalized optimization methods for training sLDA that produce interpretable topic-word parameters and useful heldout predictions, using recognition networks to speed-up inference. We report preliminary results on synthetic data and on predicting successful anti-depressant medication given a patient's diagnostic history.

研究の動機と目的

  • ラベルが高次元の臨床カウントデータに対して疎である場合に、標準的な教師ありLDAの一般化性能が低いという問題に対処すること。
  • sLDAにおける条件付き独立性仮定が、ラベルがトピック-語パラメータに与える影響を制限するという問題を克服すること。
  • 重み付き最適化を用いて生成的および判別的項のバランスを取るトレーニング目的関数を開発すること。
  • トレーニング中に高価なテスト時埋め込みを近似する認識ネットワークを活用して、スケーラブルな推論を可能にすること。
  • ホールドアウトデータにおける予測性能を向上させつつ、臨床的インサイトを得るための解釈可能なトピック-語分布を維持すること。

提案手法

  • 教師ありと教師なしの尤度の重み付き組み合わせを用いて、ドキュメント-トピック埋め込みとラベル予測の両方を同時に最適化する修正された目的関数を提案する。
  • 語カウント $ x_d $ とトピックパラメータ $ \phi $ をドキュメント-トピック分布 $ \pi_d $ にマップする理想の埋め込み関数 $ f^* $ を導入し、トレーニング時とテスト時の推論の整合性を保証する。
  • 各ドキュメントで反復的最適化を回避するために、認識ネットワークを用いて近似的な埋め込み $ f^\lambda $ を開発する。
  • 語カウントとラベルの両方の影響をバランスさせるために、勾配ベースの最適化を、罰則重み $ w_x $ と $ w_y $ を用いて実行する。
  • ベクトル化された autograd を用いた最適化により、合成データおよび実世界のEHRデータにおける効率的なトレーニングを実現する。
  • 抗うつ薬処方の成功を予測するために、80万件の患者エンカウンターからなる大規模なEHRデータセットに本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1ラベルが語カウントに対して疎である状況下で、罰則付きエンドツーエンド最適化戦略が教師ありトピックモデルの予測性能を向上させられるか?
  • RQ2理想の埋め込み関数 $ f^* $ を用いてトレーニング時とテスト時のドキュメント埋め込みを整合させることで、過学習を軽減し、一般化性能を向上させられるか?
  • RQ3認識ネットワークに基づく近似 $ f^\lambda $ は、$ f^* $ と同等の性能を達成しながら、トレーニング時間を著しく短縮できるか?
  • RQ4本手法は、標準的なsLDAおよびベースラインのbag-of-wordsロジスティック回帰と比較して、抗うつ薬治療成功の予測性能に優れているか?
  • RQ5予測精度を向上させたとしても、学習されたトピック-語パラメータが解釈可能である程度は保たれているか?

主な発見

  • 理想のエンドツーエンドトレーニング($ f^* $ を用いて)は、ラベル重みが低い場合に特に顕著に予測誤差を低減する。
  • $ f^* $ を用いることで、すべての薬剤で誤差率が低下し、イミプラミンやデシプラミンのようなレアドラッグではAUCが最大0.15向上した。
  • 近似的な埋め込み $ f^\lambda $ は、$ f^* $ に比べてトレーニング時間を3.6倍短縮したが、大多数の薬剤で競争力ある予測性能を維持した。
  • 有病率が1%以上の薬剤では、$ f^\lambda $ が $ f^* $ とAUCスコアで0.02以内の差に留まり、優れた近似品質を示した。
  • 改善が見られたものの、最良のsLDAモデルは依然として単純なbag-of-wordsロジスティック回帰ベースラインに劣っており、局所最適解の問題が示唆された。
  • 罰則重み $ w_x $ が高くても、本手法は解釈可能なトピック-語パラメータを維持でき、学習されたパターンの臨床的解釈可能性を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。