Skip to main content
QUICK REVIEW

[論文レビュー] EPICURE Ensemble Pretrained Models for Extracting Cancer Mutations from Literature

Jiarun Cao, Elke M. van Veen|arXiv (Cornell University)|Jun 11, 2021
Topic Modeling参考文献 28被引用数 4
ひとこと要約

EPICURE は、条件付きランダムフィールド(CRF)とスパン予測レイヤーを組み合わせたアンサンブルの事前学習モデルを導入し、バイオメディカル文献からのがん変異の抽出を向上させます。ベンチマークデータセットにおけるデータ拡張とファインチューニングを活用することで、がん変異の名前付きエンティティ認識において最先端のパフォーマンスを達成し、従来のルールベースや低リソース手法の限界を克服します。

ABSTRACT

To interpret the genetic profile present in a patient sample, it is necessary to know which mutations have important roles in the development of the corresponding cancer type. Named entity recognition is a core step in the text mining pipeline which facilitates mining valuable cancer information from the scientific literature. However, due to the scarcity of related datasets, previous NER attempts in this domain either suffer from low performance when deep learning based models are deployed, or they apply feature based machine learning models or rule based models to tackle this problem, which requires intensive efforts from domain experts, and limit the model generalization capability. In this paper, we propose EPICURE, an ensemble pre trained model equipped with a conditional random field pattern layer and a span prediction pattern layer to extract cancer mutations from text. We also adopt a data augmentation strategy to expand our training set from multiple datasets. Experimental results on three benchmark datasets show competitive results compared to the baseline models.

研究の動機と目的

  • バイオメディカル文献におけるがん変異抽出のためのアノテート済みデータセットの不足に取り組む。
  • ディープラーニングを用いてがん関連変異の名前付きエンティティ認識のパフォーマンスを向上させる。
  • 事前学習とデータ拡張を活用することで、専門家が設計したルールや手作業で特徴を設計する依存度を低減する。
  • 臨床的に関連する変異情報の抽出に適した汎用的で高性能なモデルを開発する。

提案手法

  • モデルは、複数のがん変異データセットでファインチューニングされた事前学習言語モデルのアンサンブルを採用する。
  • 系列ラベル付けのラベル依存性をモデル化するために、条件付きランダムフィールド(CRF)レイヤーを統合する。
  • 直接的なスパン同定を可能にするために、スパン予測ヘッドを用いる。これにより、エンティティの局所化精度が向上する。
  • 複数のソースデータセットからの訓練データ拡張にデータ拡張を適用する。
  • 文脈表現と構造的予測を組み合わせることで、エンティティ認識を強化する。
  • 汎化性能とパフォーマンスを評価するために、3つのベンチマークデータセットでファインチューニングを実施する。

実験結果

リサーチクエスチョン

  • RQ1CRF とスパン予測レイヤーを備えた事前学習モデルのアンサンブルは、既存の手法を上回るがん変異抽出性能を達成できるか?
  • RQ2データ拡張は、低リソースな変異アノテーションタスクにおけるモデルパフォーマンス向上にどの程度効果的か?
  • RQ3構造的予測(CRF)とスパン検出の統合は、バイオメディカルテキストにおけるエンティティ局所化にどの程度向上効果をもたらすか?
  • RQ4提案手法は、アノテーションスキームが異なる多様ながん変異データセットに対しても汎用性を示せるか?
  • RQ5高いパフォーマンスを維持しつつ、専門家が設計した特徴に依存するのを減らすことができるか?

主な発見

  • EPICURE モデルは、3つのベンチマークデータセットにおいてがん変異抽出で競争力のあるパフォーマンスを達成した。
  • CRF とスパン予測レイヤーの統合により、ベースラインモデルと比較して系列ラベル付けの精度が向上した。
  • データ拡張は訓練データの拡張に効果的であり、モデルのロバスト性と汎化性能を向上させた。
  • F1スコアとリコールの両面で、従来のルールベースおよび特徴工学手法を上回った。
  • 複数のデータセットでのファインチューニングにより、異なる変異タイプやテキストドメインにおいて一貫したパフォーマンス向上が得られた。
  • アンサンブルアプローチは、多様なバイオメディカル文献ソースにおいて優れた汎化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。