[論文レビュー] An evaluation of randomized machine learning methods for redundant data: Predicting short and medium-term suicide risk from administrative records and risk assessments
本研究では、7,399名の精神科患者の管理および臨床データを用いて、ランダム化された機械学習手法—ランダムフォレスト、勾配ブースティングマシン、ドロップアウトを適用した深層ニューラルネットワーク—を用いて短期および中期の自殺リスクを予測する手法を評価した。ランダム化手法は、AUCおよびF1スコアにおいて臨床医や従来のモデルを上回り、データの重複に対して高い耐性を示し、優れた予測精度を示した。
Accurate prediction of suicide risk in mental health patients remains an open problem. Existing methods including clinician judgments have acceptable sensitivity, but yield many false positives. Exploiting administrative data has a great potential, but the data has high dimensionality and redundancies in the recording processes. We investigate the efficacy of three most effective randomized machine learning techniques random forests, gradient boosting machines, and deep neural nets with dropout in predicting suicide risk. Using a cohort of mental health patients from a regional Australian hospital, we compare the predictive performance with popular traditional approaches clinician judgments based on a checklist, sparse logistic regression and decision trees. The randomized methods demonstrated robustness against data redundancies and superior predictive performance on AUC and F-measure.
研究の動機と目的
- 高次元かつ重複の多い行政および臨床データを用いて、精神科患者の自殺リスクを予測する課題に対処すること。
- ランダム化された機械学習手法が、従来の手法や臨床医の判断に比べて予測性能を向上させることを評価すること。
- 電子カルテに一般的に見られるデータの重複に対して、ランダム化モデルの耐性を調査すること。
- ランダムフォレスト、勾配ブースティングマシン、ドロップアウトを適用した深層ニューラルネットワークが、スパースロジスティック回帰、決定木、臨床医のチェックリストと比較して、予測性能にどのように差をつけるかを検討すること。
- 複数の予測期間(15〜360日)にわたり、これらの手法の有効性を検証すること。
提案手法
- 25本の木を用いたランダムフォレスト、各分割における√p個の特徴量のサブサンプリング、葉の最小サイズをn/64に設定した。
- 200個の弱学習器を用いた勾配ブースティングマシン、50%のデータサブサンプリング、min(p/3, √n)個のランダムな特徴量サブセット、動的学習率を適用した。
- 2層の隠れ層(各50ユニット)を有する深層ニューラルネットワーク、ミニバッチサイズ64の確率的勾配降下法、適応的学習率減衰を用いた。
- 複数の正則化手法を統合:重み減衰(10⁻⁴)、最大ノルム制約(値1)、および隠れユニットおよび入力特徴量の両方に0.5のドロップアウト率を適用した。
- トレーニング中にドロップアウトを適用し、ユニットを確率0.5で一時的に無効化し、推論時にはドロップアウト率で重みをスケーリングすることでモデルアンサンブルを近似した。
- EMR由来の予測変数を標準化し、類似した電子健康記録システムへの一般化を確保した。
実験結果
リサーチクエスチョン
- RQ1ランダム化された機械学習手法は、臨床医の判断や従来の統計モデルと比較して、自殺リスク予測の精度を向上させることができるか?
- RQ2ランダムフォレスト、勾配ブースティングマシン、ドロップアウトを適用した深層ニューラルネットワークは、重複が多く高次元な精神科データにおいて、AUCおよびF1スコアでどの程度の性能を示すか?
- RQ3これらのランダム化モデルは、電子カルテにおけるデータの重複や高次元性に対してどの程度耐性を示すか?
- RQ4入力層および隠れ層にドロップアウトを組み込むことで、一般化性能が向上し、過学習が軽減されるか?
- RQ5提案されたモデルの予測性能は、15〜360日という異なる予測期間においてどのように変化するか?
主な発見
- ランダム化された機械学習手法は、18項目のチェックリストを用いた臨床医の判断よりも、有意に高いAUCおよびF1スコアを達成した。
- ランダムフォレスト、勾配ブースティングマシン、ドロップアウトを適用した深層ニューラルネットワークは、すべての予測期間において、スパースロジスティック回帰および決定木と比較して、AUCおよびF1測定値で優れた性能を示した。
- ドロップアウトを適用した深層ニューラルネットワークは、特徴量および隠れユニットの両レベルでの正則化により、特に優れた性能を発揮した。
- これらのモデルはデータの重複に対して耐性を示し、lassoベースの手法とは異なり、特徴量を破棄せずに有用な情報を保持した。
- 15〜360日までの全期間にわたり、予測性能が安定しており、ランダム化モデルの優位性が一貫して維持された。
- EMRデータにおける重複特徴の影響を軽減するために、入力層でのドロップアウトの使用が特に重要であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。