Skip to main content
QUICK REVIEW

[論文レビュー] A Meta-embedding-based Ensemble Approach for ICD Coding Prediction

Pavithra Rajendran, Alexandros Zenonos|arXiv (Cornell University)|Feb 26, 2021
Topic Modeling参考文献 19被引用数 4
ひとこと要約

本論文では、臨床ノートおよび外部のバイオメディカルリソースから得られる複数の事前学習済み単語埋め込みを、幾何学的後処理および局所線形メタ埋め込み技術を用いて統合することで、I CDコード予測を向上させるメタ埋め込みベースのアンサンブルモデルを提案する。この手法は、アーキテクチャの複雑さを増すことなく、ICD-9およびICD-10コード予測の両方で性能を向上させ、融合過程において局所的なベクトル近傍構造を保持する。

ABSTRACT

International Classification of Diseases (ICD) are the de facto codes used globally for clinical coding. These codes enable healthcare providers to claim reimbursement and facilitate efficient storage and retrieval of diagnostic information. The problem of automatically assigning ICD codes has been approached in literature as a multilabel classification, using neural models on unstructured data. Our proposed approach enhances the performance of neural models by effectively training word vectors using routine medical data as well as external knowledge from scientific articles. Furthermore, we exploit the geometric properties of the two sets of word vectors and combine them into a common dimensional space, using meta-embedding techniques. We demonstrate the efficacy of this approach for a multimodal setting, using unstructured and structured information. We empirically show that our approach improves the current state-of-the-art deep learning architectures and benefits ensemble models.

研究の動機と目的

  • 臨床ノートのマルチラベルI CDコード予測を、非構造化テキストおよび構造化バイタルサインのマルチモodalデータを用いて向上させること。
  • 次元数の増加を伴わせることなく、外部のバイオメディカル知識を統合することで、臨床要約からの単語埋め込みを改善すること。
  • 多様な事前学習済み埋め込みの幾何学的統合が、I CDコード予測の性能を向上させるかどうかを調査すること。
  • テキストおよび構造化データを含む複数のモダリティからの予測を統合するアンサンブルモデルを構築し、優れた分類性能を達成すること。

提案手法

  • MIMICおよびPubMedの事前学習済み単語埋め込みをMeanDiffを用いて後処理し、意味的空間を揃えるとともに、局所的近傍構造を保持する。
  • 局所線形メタ埋め込み技術を用いて、複数の埋め込みセットを統合し、統一的で次元数の低い表現に変換する。
  • 非構造化テキスト(退院要約)および構造化データ(バイタルサイン)の異なるモダリティに対して、個別のディープラーニングモデル(例:CNN)を訓練する。
  • モダリティ固有のモデルからの予測をメタ分類器を用いてアンサンブル化し、最終的なマルチラベル分類性能を向上させる。
  • ICDコード定義を外部知識として用い、ラベル表現を豊かにすることで、臨床テキストとの意味的整合性を向上させる。
  • クラスの不均衡を管理し、信頼性の高い評価を確保するため、上位32個のICD-10コードおよび上位50個のICD-9コードを対象に性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1幾何学的メタ埋め込み技術を用いて複数の事前学習済み単語埋め込みを統合することで、単一埋め込みベースラインを上回るI CDコード予測性能が達成可能か?
  • RQ2局所的近傍構造を保持するように埋め込みを後処理することで、下流の分類性能が向上するか?
  • RQ3非構造化テキストと構造化臨床データのマルチモダリティ統合は、単一モダリティ手法よりも優れたI CDコード予測結果をもたらすか?
  • RQ4提案された埋め込み統合手法は、異なるI CDコード体系(ICD-9対I CD-10)においても有効か?
  • RQ5単語埋め込みに外部のバイオメディカル知識を統合することで、モデルの一般化性能が向上するが、アーキテクチャの変更や追加の学習データを必要としないか?

主な発見

  • MIMICおよびPubMed埋め込みにMeanDiff後処理を施した局所線形メタ埋め込み技術が、評価されたすべての構成で最高の性能を達成した。
  • 最良のモデルは、ICD-10(上位32コード)およびICD-9(上位50コード)の両方のマルチラベル分類タスクで、ベースライン手法を上回った。
  • 融合済み埋め込みを用いたCNNモデルで構造化データの予測をアンサンブル化することで、構造化データ単体を使用した場合と比較して性能が著しく向上した。
  • 最高性能を示した構成は、ICD-9およびICD-10コード予測タスクの両方で一貫しており、コード体系の違いに対して高いロバスト性を示した。
  • 埋め込み統合による外部知識の統合により、アーキテクチャの変更や追加の学習データを必要とせずに、モデル性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。