Skip to main content
QUICK REVIEW

[論文レビュー] Pre-trained Language Models in Biomedical Domain: A Survey from Multiscale Perspective

Benyou Wang, Qianqian Xie|arXiv (Cornell University)|Oct 11, 2021
Artificial Intelligence in Healthcare and Education被引用数 2
ひとこと要約

本調査は、生物医学分野における事前学習言語モデル(PLM)について、体系的かつマルチスケールなレビューを提供しており、既存のモデルを分類し、用語とベンチマークを標準化し、下流タスクにおける応用を分析している。統一された分類体系を提示し、分野間連携を促進するための主な限界と今後の研究方向性を特定している。

ABSTRACT

Pre-trained language models have been the de facto paradigm for most natural language processing (NLP) tasks. In the biomedical domain, which also benefits from NLP techniques, various pre-trained language models were proposed by leveraging domain datasets including biomedical literature, biomedical social medial, electronic health records, and other biological sequences. Large amounts of efforts have been explored on applying these biomedical pre-trained language models to downstream biomedical tasks, from informatics, medicine, and computer science (CS) communities. However, it seems that the vast majority of existing works are isolated from each other probably because of the cross-discipline characteristics. It is expected to propose a survey that not only systematically reviews recent advances of biomedical pre-trained language models and their applications but also standardizes terminology, taxonomy, and benchmarks. Therefore, this paper summarizes the recent progress of pre-trained language models used in the biomedical domain. Particularly, an overview and taxonomy of existing biomedical pre-trained language models as well as their applications in biomedical downstream tasks are exhaustively discussed. At last, we illustrate various limitations and future trends, which we hope can provide inspiration for the future research.

研究の動機と目的

  • 複数スケールにわたる最新の生物医学的事前学習言語モデルの進展を体系的にレビューすること。
  • 生物医学的PLMの用語、分類体系、評価ベンチマークを標準化すること。
  • 生物医学、インフォーマティクス、コンピュータサイエンス分野における孤立した研究活動のギャップを埋めること。
  • 生物医学NLPにおける限界と新たな傾向を特定し、今後の研究に向けた方向性を示すこと。

提案手法

  • 生物医学文献、EHR(電子歴史)、生物学的配列などの訓練データソースに基づく生物医学的PLMの分類。
  • アーキテクチャ、事前学習目的、ドメイン特化性によってモデルを分類する統一された分類体系の構築。
  • 名前付きエンティティ認識、関係抽出、質問応答などの下流生物医学タスクにおけるモデル応用の分析。
  • 再現可能性と比較可能性を可能にするために、既存のベンチマークと評価プロトコルの統合。
  • モデルの汎化性とドメイン適応に関する繰り返し発生するメソドロジカルなギャップと課題の同定。

実験結果

リサーチクエスチョン

  • RQ1生物医学的事前学習言語モデルは、アーキテクチャ、事前学習データ、目的の観点からどのように分類されるか?
  • RQ2既存の生物医学的PLMは、設計および応用の観点から、どのような主な相違点と類似点を有するか?
  • RQ3疾患予測や薬物反応モデリングなどの多様な下流タスクにおいて、生物医学的PLMはどのように性能を発揮するか?
  • RQ4生物医学NLP研究において、用語、ベンチマーク、評価プロトコルの標準化に課題が存在するか?
  • RQ5生物医学的PLM開発における主な限界と新たな研究トレンドは何か?

主な発見

  • データソース、アーキテクチャ、事前学習目的をカバーする包括的な生物医学的事前学習言語モデルの分類体系が確立された。
  • 本調査では、生物医学NLP研究において用語、ベンチマーク、評価プロトコルの標準化が不十分であることが特定された。
  • 名前付きエンティティ認識や関係抽出などのタスクでは、ドメイン特化データでファインチューニングされた場合、既存のモデルが優れた性能を示している。
  • 進展は見られるが、生物医学、インフォーマティクス、コンピュータサイエンス分野における孤立した研究活動が、分野間連携の進展を妨げている。
  • 今後の研究は、モデルの汎化性の向上、データバイアスの低減、再現可能性を高めるための共有ベンチマークの開発に注力すべきである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。