Skip to main content
QUICK REVIEW

[論文レビュー] From Extreme Multi-label to Multi-class: A Hierarchical Approach for Automated ICD-10 Coding Using Phrase-level Attention

Cansu Şen, Bingyang Ye|arXiv (Cornell University)|Feb 18, 2021
Topic Modeling参考文献 29被引用数 6
ひとこと要約

本論文は、最初にLSTMベースの文タグジャによって焦点文を特定し、その後その文を用いて教師付きアテンション機構でICDコードを割り当てる階層的2段階アプローチを提案する。この手法は、強力なベースラインと比較して、サブセット正解率で23%向上、ミクロF1で18%向上、インスタンスベースF1で15%向上を達成し、人為的にアノテートされたフレーズレベルの監視によって解釈可能性が向上している。

ABSTRACT

Clinical coding is the task of assigning a set of alphanumeric codes, referred to as ICD (International Classification of Diseases), to a medical event based on the context captured in a clinical narrative. The latest version of ICD, ICD-10, includes more than 70,000 codes. As this is a labor-intensive and error-prone task, automatic ICD coding of medical reports using machine learning has gained significant interest in the last decade. Existing literature has modeled this problem as a multi-label task. Nevertheless, such multi-label approach is challenging due to the extremely large label set size. Furthermore, the interpretability of the predictions is essential for the endusers (e.g., healthcare providers and insurance companies). In this paper, we propose a novel approach for automatic ICD coding by reformulating the extreme multi-label problem into a simpler multi-class problem using a hierarchical solution. We made this approach viable through extensive data collection to acquire phrase-level human coder annotations to supervise our models on learning the specific relations between the input text and predicted ICD codes. Our approach employs two independently trained networks, the sentence tagger and the ICD classifier, stacked hierarchically to predict a codeset for a medical report. The sentence tagger identifies focus sentences containing a medical event or concept relevant to an ICD coding. Using a supervised attention mechanism, the ICD classifier then assigns each focus sentence with an ICD code. The proposed approach outperforms strong baselines by large margins of 23% in subset accuracy, 18% in micro-F1, and 15% in instance based F-1. With our proposed approach, interpretability is achieved not through implicitly learned attention scores but by attributing each prediction to a particular sentence and words selected by human coders.

研究の動機と目的

  • 70,000以上のコードを含む極めて広大なラベル空間と、モデルの解釈可能性の低さを含む、極端な多値ラベルICD-10コード化の課題に対処すること。
  • タスクを階層的多クラス分類問題に再定式化することで、過剰コード化を低減し、予測精度を向上させること。
  • フレーズレベルでの人為的コーダーのアノテーションを直接アテンション機構に供給することで、解釈可能性を向上させること。
  • 各ICDコード予測を特定の文や単語に帰属づけるパイプラインを開発し、臨床的信頼性と透明性を向上させること。
  • しばしば意味的または選択的なアテンションスコアを生成できない、非教師付きアテンション機構の限界を軽減すること。

提案手法

  • 本手法は2段階パイプラインを採用する:LSTMベースのモデルを用いてICDコードに関連する焦点文を特定する文タグジャ。
  • 文タグジャは、各文を焦点文または非焦点文として分類する文レベルの監視により学習される。
  • 焦点文はICD分類器に渡され、複数のLSTMと教師付きアテンション機構を用いてICDコードが割り当てられる。
  • 教師付きアテンション機構は、人為的にアノテートされたフレーズレベルのデータに基づいて学習され、アテンションスコアが臨床的に関連する用語と一致するように保証される。
  • 最終的なコードセットは、焦点文からのすべての予測されたICDコードの和集合として生成され、予測が特定の文や単語に追跡可能である。
  • 文タグジャの微調整により、ICD分類器に渡される文の数を制御でき、過剰予測を低減できる。

実験結果

リサーチクエスチョン

  • RQ1極端な多値ラベルICD-10コード化を階層的多クラス分類問題に再定式化することで、予測性能の向上と過剰コード化の低減が図れるか?
  • RQ2フレーズレベルの人為的アノテーションが、ICDコード化モデルにおけるアテンション機構の解釈可能性と正確性を向上させられるか?
  • RQ3文のタグ付け followed by コード割り当てという2段階パイプラインが、エンドツーエンドの多値ラベルモデルと比較してICD-10コード化で優れた性能を発揮するか?
  • RQ4教師付きアテンション機構は、非教師付きアテンションと比較して、臨床的に意味のある説明をどの程度提供できるか?
  • RQ5複数の類似した文が臨床ノートに存在する場合、階層的設計がモデルのロバストネスにどのように影響するか?

主な発見

  • 提案されたパイプラインは、大規模なテストセットにおいて、強力なベースラインと比較して、サブセット正解率で23%向上、ミクロF1で18%向上、インスタンスベースF1で15%向上した。
  • ベースラインモデルと比較して過剰予測の影響が小さく、文タグジャの感度を調整することでさらに低減できる。
  • 文タグジャが焦点文を誤って特定しても、その文に関連する内容が含まれていれば、ICD分類器は依然として正しいコードを割り当てられ、性能が維持される。
  • 教師付きアテンション機構は、『Melanocytic Nevus』のような臨床的に関連する用語を、コード予測の根拠として効果的に特定した。これは、人為コーダーの判断と一致した。
  • 本手法は、各ICDコードを特定の文および人為コーダーがアノテートした単語に明示的に関連付けることで、暗黙的に学習されたアテンションスコアとは異なり、優れた解釈可能性を達成した。
  • 複数の類似した文が存在する場合でも、最終的なコードセットが和集合として形成されるため、文タグジャの不完全さにかかわらず、正しい予測が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。