QUICK REVIEW
[論文レビュー] Classifying medical notes into standard disease codes using Machine Learning
Amitabha Karmakar|arXiv (Cornell University)|Feb 1, 2018
Text and Document Classification Technologies参考文献 8被引用数 7
ひとこと要約
本稿では、自己注意機構を備えた畳み込みニューラルネットワーク(CNN)を用いた深層学習アプローチを提案し、臨床的退院ノートを標準的な ICD-9 疾病コードに自動分類する。この手法は、MIMIC-III データセット全体を用いて Level 1 ICD-9 コードで 79.7% の F1 スコアを達成し、先行モデルを上回り、このタスクにおいて CNN と注意機構の組み合わせが、LSTM や階層的モデルよりも優れていることを示している。
ABSTRACT
We investigate the automatic classification of patient discharge notes into standard disease labels. We find that Convolutional Neural Networks with Attention outperform previous algorithms used in this task, and suggest further areas for improvement.
研究の動機と目的
- 深層学習を用いて、臨床的退院ノートを標準的な ICD-9 疾病コードに自動分類することを目的とする。
- 自己注意機構と CNN が、LSTM や階層的分類器といった従来のモデルを上回るかどうかを評価することを目的とする。
- ラベルの階層構造、データサイズ、埋め込み戦略の影響がモデル性能に与える影響を調査することを目的とする。
- 修正された訓練指標を用いることで、簡略化された ICD 番号付与アプローチと完全な ICD 番号付与アプローチを統合する可能性を検討することを目的とする。
- 事前学習された埋め込み表現が臨床テキスト分類タスクにおいてどの程度有用であるかを評価することを目的とする。
提案手法
- 本研究では、MIMIC-III データベースの 52,696 件の退院ノートを対象に、マルチラベル・マルチクラス分類フレームワークを用いる。
- 臨床的テキスト内の局所的および長距離依存関係を捉えるために、自己注意機構を備えた CNN モデルと、そうでないモデルを適用する。
- トレーニング可能な単語埋め込みを採用し、追加で WikiGloVe と MIMIC ノートで事前学習されたカスタム埋め込みを用いた実験も実施する。
- トレーニングの安定性と性能向上を図るため、ラベルを階層構造に基づいて 17 個の Level 1 ICD-9 コードに縮小する。
- 比較のため、文単位の LSTM を用いた階層的モデルも実装し、時間的進行をモデル化するための文分割を適用する。
- 訓練の目的関数には F1 スコア最適化を用い、注意機構、埋め込み、ラベル縮小のアブレーションスタディも実施する。
実験結果
リサーチクエスチョン
- RQ1自己注意機構を備えた CNN は、標準的な CNN や LSTMs、階層的モデルよりも、臨床的ノートを ICD-9 コードに分類するタスクで優れているか?
- RQ2ICD-9 コードの数を Level 1 階層にまで削減することは、分類性能とモデルの一般化能力にどのような影響を与えるか?
- RQ3事前学習された埋め込み表現は、臨床的ノート分類タスクの性能向上にどの程度寄与するか?
- RQ4注意機構は、文の固定分割による制限を緩和し、臨床的ナラティブのモデリングに寄与するか?
- RQ5階層的ラベルの近接性を考慮した訓練指標に適応させることで、簡略化された ICD 番号付与と完全な ICD 番号付与を統合することは可能か?
主な発見
- 自己注意機構を備えた CNN モデルは、5K の検証セットで最高の F1 スコア(78.2%)を達成したが、全データセットでは過学習のため性能が劣化した。
- 標準的な CNN モデルは、17 個の Level 1 ICD-9 コードに分類するタスクで、全データセットで 79.7% の F1 スコアを達成し、文献に報告されたすべての先行手法を上回った。
- 階層的 LSTM モデルは、両方の CNN バリエーションよりも性能が低く、この文脈では文単位の時間的構造をモデル化しても限定的な利点にとどまった。
- WikiGloVe からの事前学習埋め込みはわずかに性能を低下させたが、MIMIC ベースのカスタム埋め込みは 0.01% の向上をもたらし、ドメイン特化の事前学習がより効果的であることを示唆した。
- 希少な Level 5 コードではなく、より大きな、偏りの少ないラベルセット(17 個の Level 1 コード)を用いることで、モデルの性能が顕著に向上した。
- 本研究では、畳み込みフィルタが文書レベルの抽象的特徴を暗黙的に学習していることが判明し、これは、文の分割に依存するモデルよりも CNN の優れた性能を説明する要因であると考えられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。