[論文レビュー] Development of deep learning algorithms to categorize free-text notes pertaining to diabetes: convolution neural networks achieve higher accuracy than support vector machines
本研究では、電子歴史記録(EHR)内の糖尿病関連ノートを分類するためのディーブラーニングモデル、特に畳み込みニューラルネットワーク(CNNs)の開発と評価を行った。ブリガムズアンドウィメンズ病院から2,000件のアノテート済みEHRノートと、テキサス大学医師団から1,000件のノートを用い、分離可能CNNモデルは、自身の機関のテストセットでAUC 0.975を達成し、外部検証では0.875を記録した。これは、内部での正確性においてサポートベクターマシン(SVMs)を上回ったが、異なる機関間での一般化性能にはトレードオフが生じた。
Health professionals can use natural language processing (NLP) technologies when reviewing electronic health records (EHR). Machine learning free-text classifiers can help them identify problems and make critical decisions. We aim to develop deep learning neural network algorithms that identify EHR progress notes pertaining to diabetes and validate the algorithms at two institutions. The data used are 2,000 EHR progress notes retrieved from patients with diabetes and all notes were annotated manually as diabetic or non-diabetic. Several deep learning classifiers were developed, and their performances were evaluated with the area under the ROC curve (AUC). The convolutional neural network (CNN) model with a separable convolution layer accurately identified diabetes-related notes in the Brigham and Womens Hospital testing set with the highest AUC of 0.975. Deep learning classifiers can be used to identify EHR progress notes pertaining to diabetes. In particular, the CNN-based classifier can achieve a higher AUC than an SVM-based classifier.
研究の動機と目的
- 自由記述形式のEHRノートに関する糖尿病関連の分類を正確に行うディーブラーニングモデルの開発を目的とする。
- 従来のサポートベクターマシン(SVMs)と比較して、畳み込みニューラルネットワーク(CNNs)、再帰ニューラルネットワーク(RNNs)、ハイブリッドモデルの性能を評価すること。
- 異なる機関からの外部データセットを用いた検証により、モデルの一般化性能を評価すること。
- ディーブラーニングモデルが、実用的な導入可能性を維持しつつ、SVMを上回る正確性を達成できるかどうかを特定すること。
提案手法
- 本研究では、ブリガムズアンドウィメンズ病院から2,000件の手動アノテート済みEHRプログレスノート(訓練用1,000件、テスト用1,000件)を用い、追加でテキサス大学医師団から1,000件のノートを外部検証に使用した。
- テキストは単語から番号へのインデックスマップを用いてトークン化およびエンコードされ、20,218語の固有語彙が得られた。
- 標準CNN、分離可能CNN、RNN、およびハイブリッドCNN-RNNモデルを含む複数のディーブラーニングアーキテクチャを訓練した。入力には単語埋め込みを用いた。
- モデルの性能は受信者操作特性曲線(ROC)の下側面積(AUC)を用いて評価され、検証損失に基づく早期停止が適用された。
- 分離可能CNN(モデルg)は、速度と正確性の両立を最適化し、性能と推論時間のバランスが最も優れていた。
- 再現性を確保するため、NumPyおよびTensorFlowの両レベルで固定されたランダムシードを用いてハイパーパramータをチューニングした。
実験結果
リサーチクエスチョン
- RQ1ディーブラーニングモデル、特にCNNsが、従来のSVMsよりも糖尿病関連EHRノートの分類において優れていると言えるか?
- RQ2内部テスト(ブリガムズアンドウィメンズ病院)と外部検証(テキサス大学医師団)との間で、モデルの性能はどのように変化するか?
- RQ3CNNとRNN(例:双方向LSTM)を組み合わせることで、専門的なEHRテキストの分類性能が向上するか?
- RQ4異なる臨床的ノート作成スタイルを持つ機関間で、ディーブラーニングモデルの一般化性能はどの程度達成できるか?
- RQ5分離可能畳み込みは、標準畳み込みと比較して、正確性と推論速度の両方を向上させることができるか?
主な発見
- 分離可能CNNモデル(モデルg)は、ブリガムズアンドウィメンズ病院データセットで最高のテストAUC 0.975を達成し、SVMベースラインを著しく上回った。
- テキサス大学医師団の外部検証セットでは、最高のCNNモデルがAUC 0.875を達成したが、これは内部性能より低かったが、SVMの一般化性能を上回った。
- RNNベースのモデル、特に双方向LSTMは、純粋なCNNよりも性能が向上しなかった。また、高度に専門化したEHRノートの二値分類には効果的ではなかった。
- CNNの後にLSTMレイヤーを追加しても性能向上が得られず、ハイブリッドCNN-RNNモデルはこのデータセットでは相乗効果を示さなかった。
- BWHデータで訓練されたCNNモデルは、機関固有のノート作成様式を捉えており、その機関内での正確性を高めたが、他の機関への一般化性能を低下させた。
- 一般化性能が低くとも、CNNモデルはSVMより高速かつ正確であり、標準ラップトップで161秒で学習が完了した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。