Skip to main content
QUICK REVIEW

[論文レビュー] GERNERMED++: Transfer Learning in German Medical NLP

Johann Frei, Ludwig Frei‐Stuber|arXiv (Cornell University)|Jun 29, 2022
Topic Modeling被引用数 5
ひとこと要約

本論文は、GottBERTおよびGermanBERTという事前学習済みドイツ語BERTモデルを用いたトランスファーラーニング、公開済み英語医療データセットからドイツ語テキストを生成する神経機械翻訳(NMT)、および語のアライメントを用いて英語のアノテーションをドイツ語に投影する手法を組み合わせた、名前付きエンティティ認識(NER)向けの耐障害性があり公開可能なドイツ語医療NLPモデル、GERNMED++を紹介する。このモデルは、特許権的または手作業でアノテートされたドイツ語データを一切使用せず、複数の外部データセットで先行するオープンソースモデル(GERNMEDおよびGGPONC)を著しく上回り、特許権のないデータを用いた状態を凌駕する性能を達成している。

ABSTRACT

We present a statistical model for German medical natural language processing trained for named entity recognition (NER) as an open, publicly available model. The work serves as a refined successor to our first GERNERMED model which is substantially outperformed by our work. We demonstrate the effectiveness of combining multiple techniques in order to achieve strong results in entity recognition performance by the means of transfer-learning on pretrained deep language models (LM), word-alignment and neural machine translation. Due to the sparse situation on open, public medical entity recognition models for German texts, this work offers benefits to the German research community on medical NLP as a baseline model. Since our model is based on public English data, its weights are provided without legal restrictions on usage and distribution. The sample code and the statistical model is available at: https://github.com/frankkramer-lab/GERNERMED-pp

研究の動機と目的

  • 名前付きエンティティ認識(NER)のための、公開可能で高品質なドイツ語医療NLPリソースの不足に応えること。
  • 利用可能な英語医療データセットを活用することで、限定的なアノテート済みドイツ語医療テキストの課題を克服すること。
  • 特許権的または手作業でアノテートされたドイツ語データを一切使用せず、法的およびプライバシー遵守を確保する、耐障害性のあるトランスファーラーニング型NERモデルの開発。
  • 外部データセットおよび分布外(OoD)データセットにおいて、GERNMEDおよびGGPONCといった既存のオープンソースドイツ語医療NERモデルを上回ること。
  • ドイツ語医療NLPコミュニティに再現可能でオープンソースのベースラインモデルを提供し、使用制限なしの権利を保証すること。

提案手法

  • 主に医療エンティティのアノテーションを提供する2018年n2c2共有タスクデータセット(英語)を用いた。
  • 神経機械翻訳(NMT)を用いて英語医療テキストをドイツ語に翻訳し、合成されたドイツ語医療コーパスを生成した。
  • 語のアライメント技術を用いて、英語のソースのトークンレベルのアノテーションを手作業ラベルなしに、対応するドイツ語翻訳に投影した。
  • NMTで生成されたアノテーションを投影したドイツ語データセット上で、事前学習済みドイツ語BERTモデル(GottBERTおよびGermanBERT)を微調整し、下流のNERタスクに適用した。
  • 同じデータパイプラインを用いて、比較用のベースラインとして軽量なSpaCyベースのモデルを訓練した。
  • テストセット、分布外(OoD)データ、複数の公開外部データセットを用いてモデルの性能を評価し、耐障害性および汎化能力を検証した。

実験結果

リサーチクエスチョン

  • RQ1公開済みで特許権のない英語医療データセットおよび翻訳技術を用いて、ドイツ語医療NERモデルを効果的に訓練できるか?
  • RQ2NMTとアノテーションの投影により生成された合成ドイツ語データ上で、事前学習済みドイツ語BERTモデルを微調整することで、NER性能がどのように向上するか?
  • RQ3GERNMED++は、分布外および外部データセットにおいて、GERNMEDおよびGGPONCといった既存のオープンソースドイツ語医療NERモデルをどの程度上回るか?
  • RQ4トランスファーラーニングと合成データの使用は、手作業でアノテートされたドイツ語医療コーパスの不足を補いながら、モデルの耐障害性を維持できるか?
  • RQ5内部または非公開医療データにアクセスできない状態で訓練されたモデルが、競争力のある性能を発揮し、研究コミュニティと法的に共有可能か?

主な発見

  • GottBERTエンコーダーを搭載したGERNMED++は、MedlineデータセットでF1スコア0.772を達成し、ベースラインのGERNMED(F1: 0.300)およびGGPONCリファレンスマodel(F1: 0.628)を著しく上回った。
  • BRONCOデータセットでは、GottBERTベースのモデルがF1スコア0.739を記録し、GGPONCモデル(F1: 0.384)およびGermanBERTベースのモデル(F1: 0.680)を上回った。
  • n2c2データセットでは、GottBERTを搭載したGERNMED++がF1スコア0.766を達成し、GGPONCモデル(F1: 0.628)および元のGERNMEDモデル(F1: 0.300)を上回った。
  • モデルは分布外(OoD)データにおいても優れた汎化性能を示し、事前学習言語モデルからの有効なトランスファーラーニングが実現したことを示した。
  • 複数のデータセットにわたり一貫した性能向上が確認され、NMT、アノテーションの投影、トランスファーラーニングの組み合わせが、耐障害性があり再現可能な結果をもたらすことがわかった。
  • 特許権のないデータを用い、手作業でカスタマイズされたドイツ語データセットで訓練されたモデルと同等またはそれを上回る性能を発揮したが、これは公開済みの英語データと特許権のないデータのみを用いたことによる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。