Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Pseudo-Labeling for Extractive Summarization on Electronic Health Records

Xiangan Liu, Keyang Xu|arXiv (Cornell University)|Nov 20, 2018
Machine Learning in Healthcare参考文献 14被引用数 9
ひとこと要約

本論文は、縦断的臨床ノート間の内在的相関を活用して、電子歴史記録(EHRs)の抽出的要約のための教師なし擬似ラベル化手法を提案する。疾患関連医療エンティティと整数線形計画法(ILP)を用いて擬似ラベルを生成し、そのラベルで教師ありニューラルモデルを学習させることで、人為的アノテーションが不要な状態でROUGEスコアにおいて従来の教師なしベースラインを上回り、最先端の性能を達成した。

ABSTRACT

Extractive summarization is very useful for physicians to better manage and digest Electronic Health Records (EHRs). However, the training of a supervised model requires disease-specific medical background and is thus very expensive. We studied how to utilize the intrinsic correlation between multiple EHRs to generate pseudo-labels and train a supervised model with no external annotation. Experiments on real-patient data validate that our model is effective in summarizing crucial disease-specific information for patients.

研究の動機と目的

  • 抽出的要約のためのEHRのアノテーションにかかる高コストを低減するため、人為的ラベルの必要性を排除すること。
  • 同じ患者からの複数の臨床ノート間の内在的相関を活用して、要約性能を向上させること。
  • 疾患関連医療エンティティとノート間の時間的整合性を用いて、高品質な擬似ラベルを生成する手法を開発すること。
  • これらの擬似ラベルで教師ありニューラルモデルを学習させ、教師なし手法に比べて一般化性能を向上させること。
  • 新規性と位置特徴を組み込むことで要約品質がどのように向上するかを検証すること。

提案手法

  • 後続のノートに含まれる疾患関連医療エンティティに基づくカバレッジスコアを用いて要約品質を測定し、逆文書頻度(IDF)および意味的類似度で重み付けする。
  • 長さ制約下で関連エンティティのカバレッジを最大化する目的関数を整数線形計画法(ILP)を用いて定式化する。
  • 事前学習済みのPubMed単語埋め込みと平均プーリングを用いて、エンティティと文の意味的類似度を計算する。
  • Bi-GRUベースのニューラルモデルにアテンションを組み合わせ、抽出的要約のための文脈に依存する文表現を学習する。
  • 最大マージナルレルバンス(MMR)による新規性と位置バイアスを組み込み、冗長性を低減し、文選択を改善する。
  • 最適化目的関数における非滑らかな最大演算を扱うために、log-sum-exp近似を適用する。

実験結果

リサーチクエスチョン

  • RQ1同じ患者に対する疾患特異的要約の品質をどのように測定すべきか?
  • RQ2RQ1の基準に基づき、その基準を最も満たす擬似ラベルをどのように生成できるか?
  • RQ3RQ2で得られた擬似ラベルを前提とした場合、医療現場向けの要約に適したモデルアーキテクチャは何か?
  • RQ4新規性と位置特徴は要約性能にどのように影響するか?

主な発見

  • 提案手法は、最高のROUGE-1(0.53)、ROUGE-2(0.38)、ROUGE-L(0.51)スコアを達成し、すべての教師なしベースラインを上回った。
  • 新規性コンponentを除去すると、ROUGE-1は0.48、ROUGE-2は0.33に低下し、冗長性低減の重要性が示された。
  • 位置特徴を除外すると、ROUGE-1は0.50、ROUGE-Lは0.49に向上した。これは、テンプレート化された臨床ノートにおいて位置バイアスが性能向上に寄与していることを示唆している。
  • 本手法は、非臨床的指示(例:患者の自己ケアのアドバイス)を正しく除外したが、TF-IDF + MMRのような教師なし手法は誤ってそれらを選択していた。
  • エンティティ・グリーディ手法に比べ、短く高効果な文(例:「慢性収縮性心不全」)を識別する能力に優れていた。
  • ILPを用いて生成された擬似ラベルは、疾患特異的関連性を効果的に捉えており、ニューラルモデルが教師なしアプローチよりも優れた一般化性能を発揮できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。