[論文レビュー] Seeing The Whole Patient: Using Multi-Label Medical Text Classification Techniques to Enhance Predictions of Medical Codes
本論文では、多動態疾患を有する患者のICD-9コード予測のためのマルチラベル医療テキスト分類を向上させるために、高次元で医療に特化した単語埋め込み(特に600次元のSkip-gramモデル)の使用を提案する。この埋め込みが、とくにレアな医療コードにおいてF-measureを顕著に向上させることを示し、匿名化済みEHRデータにおけるテキスト前処理の恩恵は最小限であることが明らかになった。
Machine learning-based multi-label medical text classifications can be used to enhance the understanding of the human body and aid the need for patient care. We present a broad study on clinical natural language processing techniques to maximise a feature representing text when predicting medical codes on patients with multi-morbidity. We present results of multi-label medical text classification problems with 18, 50 and 155 labels. We compare several variations to embeddings, text tagging, and pre-processing. For imbalanced data we show that labels which occur infrequently, benefit the most from additional features incorporated in embeddings. We also show that high dimensional embeddings pre-trained using health-related data present a significant improvement in a multi-label setting, similarly to the way they improve performance for binary classification. High dimensional embeddings from this research are made available for public use.
研究の動機と目的
- 多動態疾患を有する患者における複数の同時発生する医療コード(ICD-9)の予測を、マルチラベルテキスト分類を用いて向上させること。
- 特に次元数とアーキテクチャ(Skip-gram対CBOW)の違いが、不均衡な医療テキストデータにおける性能に与える影響を調査すること。
- 匿名化データセット(例:MIMIC-III)における自由記述型臨床テキストの前処理が、分類性能に与える影響を評価すること。
- マルチラベル医療NLPタスクにおけるさまざまなタギング戦略(例:品詞タギング、テキスト分割タグ)および分類器構成の効果を評価すること。
- 広く研究利用可能な高品質な事前学習済み医療テキスト埋め込みを公開し、臨床NLP分野における研究を促進すること。
提案手法
- MIMIC-IIIデータセットの匿名化臨床ノートを用いて、さまざまな埋め込み次元(300、600)および事前学習戦略を用いて、Skip-gramおよびCBOWモデルによる単語埋め込みを学習した。
- ICD-9コードの予測に、論理的回帰とエラスティックネット正則化(ECC)をベース分類器とするマルチラベル分類フレームワークを採用した。
- 複数の埋め込みバリアントを検討した:W300(Word2Vec)、T300/T600(300/600次元のfastText)、CONCAT300/350(連結埋め込み)、および品詞(POS)またはテキスト分割タグを付加した埋め込み。
- 18、50、155のICD-9コードラベルに対して、マイクロ平均およびマクロ平均F1スコアを用いて性能を評価し、ラベル頻度ごとの個別分析も実施した。
- 前処理済みテキスト(トークン化、2500トークンまで切り詰め)と生テキストを比較し、匿名化済みEHRにおける前処理の有効性を評価した。
- タギング手法および埋め込みタイプのアブレーションスタディを実施し、特定の設計選択による性能向上要因を特定した。
実験結果
リサーチクエスチョン
- RQ1異なる埋め込みアーキテクチャ(例:Skip-gram対CBOW)は、レアなおよび一般的なICD-9コードにおけるマルチラベル医療テキスト分類性能にどのように影響するか?
- RQ2埋め込み次元数の増加(例:300対600)は、とくに頻度が低い医療コードにおけるF-measureをどの程度向上させるか?
- RQ3自由記述型臨床テキストの前処理(例:トークン化、切り詰め)は、生テキストを使用した場合と比較してF-measureに顕著な向上をもたらすか?
- RQ4さまざまなタギング戦略(品詞、テキスト分割タグ)は、マルチラベル医療テキスト分類モデルの性能にどのように影響するか?
- RQ5複数の埋め込みタイプの組み合わせ(例:CONCAT300)は、多動態疾患予測タスクにおける全体の分類性能にどのような影響を及えるか?
主な発見
- 600次元の埋め込みを用いたSkip-gramモデル(T600SG)は、すべてのラベルセット(18、50、155)において最高のマイクロ平均およびマクロ平均F1スコアを達成し、155ラベルタスクではマクロF1が0.674を記録した。
- 稀なICD-9コード(例:410.71:F-measureが0.332から0.404に向上、410.70:0.329から0.404に向上)において、高次元埋め込み(T600SG)が最大の相対的改善をもたらした。
- 臨床テキストの前処理(例:2500トークンまで切り詰め、標準的なトークン化)は、生テキストを使用した場合と比較してF-measureに僅かな向上しかもたらさなかった。これは、すでに匿名化済みデータでは前処理の恩恵が限定的であることを示唆している。
- T300埋め込みは、すべてのラベルセットでW300を上回り、マクロF1スコアで18ラベルで+0.005、50ラベルで+0.011、155ラベルで+0.013の改善を示した。これは、高次元埋め込みが一貫して優れていることを示している。
- テキスト分割タグ(T300, TextSplitTag)の使用により、155ラベルタスクにおけるマクロF1は0.684に上昇し、標準的な品詞タギング(0.646)を上回った。これは、構造化されたタギングが表現力を向上させられることを示している。
- 最良のモデル(T600SG)は、155ラベルタスクでマイクロF1が0.745、マクロF1が0.674を達成し、高次元で医療に最適化された埋め込みが、多動態疾患状況におけるマルチラベル予測を顕著に向上させることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。