[論文レビュー] Generalized Zero-shot ICD Coding
本稿では、コードの説明文と階層構造を用いてゼロショット ICD コードの潜在特徴を合成し、入力テキストから関連キーワードを再構築することで意味的整合性を確保する、敵対的生成モデル AGMC-HTS を提案する。MIMIC-III データセットにおいて、ゼロショット ICD コードで 20.91% の F1 スコアを達成し、最先端手法比で 3% の絶対的 AUC 向上を達成した。
The International Classification of Diseases (ICD) is a list of classification codes for the diagnoses. Automatic ICD coding is in high demand as the manual coding can be labor-intensive and error-prone. It is a multi-label text classification task with extremely long-tailed label distribution, making it difficult to perform fine-grained classification on both frequent and zero-shot codes at the same time. In this paper, we propose a latent feature generation framework for generalized zero-shot ICD coding, where we aim to improve the prediction on codes that have no labeled data without compromising the performance on seen codes. Our framework generates pseudo features conditioned on the ICD code descriptions and exploits the ICD code hierarchical structure. To guarantee the semantic consistency between the generated features and real features, we reconstruct the keywords in the input documents that are related to the conditioned ICD codes. To the best of our knowledge, this works represents the first one that proposes an adversarial generative model for the generalized zero-shot learning on multi-label text classification. Extensive experiments demonstrate the effectiveness of our approach. On the public MIMIC-III dataset, our methods improve the F1 score from nearly 0 to 20.91% for the zero-shot codes, and increase the AUC score by 3% (absolute improvement) from previous state of the art. We also show that the framework improves the performance on few-shot codes.
研究の動機と目的
- 多くの ICD コードにラベル付きトレーニング例が存在しない、マルチラベル臨床テキスト分類における一般化ゼロショット学習の課題に対処すること。
- ICD コード頻度の長尾分布に起因する見出しコードの分類性能の低下を防ぎつつ、ゼロショット ICD コードにおける分類性能を向上させること。
- ICD コードの階層構造を活用して特徴生成をガイドし、合成特徴の意味的関連性を高めること。
- 入力文書からコード関連キーワードを再構築することで、生成特徴と実臨床テキストとの間の意味的整合性を保証すること。
- ゼロショットシナリオにとどまらず、限られたラベル付きデータを有する少サンプルコードに対しても性能を向上させるフレームワークの拡張
提案手法
- コードのテキスト的説明に基づいて潜在特徴を生成する条件付き生成的敵対ネットワーク(GAN)である AGMC-HTS を提案する。
- ICD コードの木構造において、ゼロショットコードがその最も近い兄弟コードの特徴に類似するように生成を促すことで、ICD コードの階層構造を統合する。
- 条件付き ICD コードに関連するキーワードを入力文書から再構築する疑似サイクル生成アーキテクチャを実装し、実特徴と生成特徴の間の意味的整合性を保証する。
- 訓練の安定化と特徴品質の向上を図るため、新しい $γ$-重み付き勾配ペナルティ($\mathcal{L}_{\texttt{WGAN-Z}}$)を導入した修正版 WGAN-GP 損失を生成器と識別器の訓練に用いる。
- 生成された特徴を用いて ICD コード分類器をファインチューニングし、未学習コードへの一般化性能を向上させる。
- 生成特徴から関連キーワードを再構築するためのキーワード再構築損失($\mathcal{L}_{\texttt{KEY}}$)を導入し、別途の予測器を訓練することで意味的整合性を維持する。
実験結果
リサーチクエスチョン
- RQ1生成モデルは、学習済みコードの精度を損なうことなく、ゼロショット ICD コーディング性能を効果的に向上させることができるか?
- RQ2ICD コードの階層構造を組み込むことで、未学習コードの生成特徴の質と意味的関連性はどのように向上するか?
- RQ3生成特徴から再構築されたキーワードは、実臨床テキストとの意味的整合性をどの程度保持するか?
- RQ4提案フレームワークは、限られたラベル付き例を有する少サンプルコードに対しても汎用性を示すか?
- RQ5階層的およびキーワード制約を組み込んだ本手法の敵対的訓練は、既存の GAN ベースまたは非生成的手法と比較して、マルチラベル ICD コーディングにおいてどのように優れているか?
主な発見
- 提案手法はゼロショット ICD コードで 20.91% の F1 スコアを達成し、従来手法ではほぼ 0% に留まっていたのを改善した。
- MIMIC-III データセットにおいて、本手法は前人最高水準の手法比で AUC スコアを 3 パーセンテージポイント(絶対的向上)向上させた。
- γ-重み付き WGAN 損失($\mathcal{L}_{\texttt{WGAN-Z}}$)とキーワード再構築($\mathcal{L}_{\texttt{KEY}}$)を組み合わせたアプローチが最良の性能を示し、少サンプルコードで 20.15% の F1 スコアを達成した。
- 本モデルは少サンプルコードの再現率と F1 スコアを向上させ、限られた学習データでも有効性を示した。
- 定性的分析により、ゼロショットコードからの生成特徴が意味的に関連するキーワード(例:コード V10.62 に対して「leukemia」、「CML」)を再構築できることを確認し、クラスの意味的性質が保持されていることが示された。
- 階層的インダクティブバイアスとキーワード再構築メカニズムにより、ベースライン GAN と比較して合成特徴の質と関連性が顕著に向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。