Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Study of Multi-Task Learning on BERT for Biomedical Text Mining

Yifan Peng, Qingyu Chen|arXiv (Cornell University)|May 6, 2020
Topic Modeling参考文献 39被引用数 12
ひとこと要約

本稿では、複数のデコーダーを備えたBERTを用いたマルチタスク学習(MTL)フレームワークを提案し、生物医学的および臨床的NLPタスクを共同で微調整することで、8つの多様なタスクで最先端の性能を達成した。MTLで微調整されたモデルは、それぞれの生物医学的および臨床的ベンチマークで、単一タスクのBERTバージョンよりも2.0%および1.3%の向上を示し、ペairワイズ MTL ではタスク固有の転送効果が明らかになった。

ABSTRACT

Multi-task learning (MTL) has achieved remarkable success in natural language processing applications. In this work, we study a multi-task learning model with multiple decoders on varieties of biomedical and clinical natural language processing tasks such as text similarity, relation extraction, named entity recognition, and text inference. Our empirical results demonstrate that the MTL fine-tuned models outperform state-of-the-art transformer models (e.g., BERT and its variants) by 2.0% and 1.3% in biomedical and clinical domains, respectively. Pairwise MTL further demonstrates more details about which tasks can improve or decrease others. This is particularly helpful in the context that researchers are in the hassle of choosing a suitable model for new problems. The code and models are publicly available at https://github.com/ncbi-nlp/bluebert

研究の動機と目的

  • 共有BERTエンコーダーを用いたマルチタスク学習が、多様な生物医学的および臨床的NLPタスクの性能向上に寄与するかどうかを調査すること。
  • 生物医学的および臨床的NLPにおいてラベル付きデータが限られる低リソース環境において、MTLの有効性を評価すること。
  • どのタスクの組み合わせが性能向上または低下をもたらすかを特定し、新しいタスクに対するモデル選択を支援すること。
  • 異なる事前学習戦略(例:PubMedのみ vs. PubMed + 臨床ノート)がMTL性能に与える影響を比較すること。
  • 広く研究利用可能で再現性の高いコードおよび事前学習済みMTLモデルを公開すること。

提案手法

  • テキスト類似度、関係抽出、名前付きエンティティ認識、テキスト推論を含む8つの生物医学的および臨床的NLPタスクに、共有BERTエンコーダーと複数のタスク固有のデコーダーを用いて微調整する。
  • すべてのタスクを同時に学習するマルチタスクリファインメントモデル(MT-BERT-Refinement)を事前学習し、その後個々のタスクに微調整する(MT-BERT-Fine-Tune)。
  • 任意の2つのタスクを同時に学習するペアワイズMTLを用い、有益または有害なタスクの組み合わせを特定する。
  • BioBERT、ClinicalBERT、BlueBERTの異なるBERTバージョンを用い、事前学習データ(PubMed、臨床ノート、または両方)の違いがMTL性能に与える影響を比較する。
  • BLUEベンチマークを用いて、生物医学的および臨床的ドメインそれぞれにMT-BERT-Fine-Tuneアプローチを適用し、評価する。
  • BLUEベンチマークを用いて、多様なテキストジャンルとNLPタスクにわたる一般化性能を評価し、MTLの利点の妥当性を確認する。

実験結果

リサーチクエスチョン

  • RQ1共有BERTエンコーダーを用いたマルチタスク学習は、単一タスクの微調整に比べ、個々の生物医学的および臨床的NLPタスクの性能向上に寄与するか?
  • RQ2どのタスクの組み合わせが最も顕著な性能向上をもたらし、どの組み合わせが有害な影響を及ぼすか?
  • RQ3事前学習データ(例:PubMedのみ vs. PubMed + 臨床ノート)は、生物医学的および臨床的ドメインにおけるMTLモデルの性能にどのように影響するか?
  • RQ41つのMTLモデルがすべてのタスクで最先端の性能を達成でき、新しいタスクへの効率的な展開を可能にするか?
  • RQ5データ特性(例:ラベルセットのサイズ、コーパスサイズ)は、生物医学的NLPにおけるマルチタスク学習の成功をどの程度予測できるか?

主な発見

  • MT-BERT-Fine-Tuneモデルは、生物医学的タスクで単一タスクBERTより平均2.0%の性能向上を達成し、臨床的タスクでは1.3%の向上を示し、新たな最先端の結果を確立した。
  • ペアワイズMTL分析から、MedNLIとi2b2 2010 reタスクは、組み合わせによって他のタスクに好影響または悪影響を及ぼすことが判明。特にi2b2 2010 reタスクは、ラベルの多様性が高いため、混合効果を示した。
  • 臨床的タスクではMT-BlueBERT-Fine-Tuneが他のバージョンを上回り、すべてのBLUEタスクで平均性能が最良のMT-BioBERT-Fine-Tuneを記録した。
  • PubMedと臨床ノートの両方で事前学習することで、臨床的タスクの性能が顕著に向上したが、生物医学的タスクにはほとんど影響がなかった。
  • ラベルセットが大きいタスク(例:DDI、ChemProt)はMTLの恩恵を最も受けやすく、一方、大規模な学習データを持つタスク(例:BC5CDR)は最小限の向上にとどまった。
  • MTLリファインメントステップ(MT-BERT-Refinement)は一貫した改善を示し、2段階アプローチ(共同事前学習 → タスク固有の微調整)の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。