[論文レビュー] Building Chinese Biomedical Language Models via Multi-Level Text Discrimination
本稿では、トークンレベルとシーケンスレベルの対照学習を組み合わせた新規のマルチレベルテキスト特徴抽出フレームワークを用いて、スクラッチから事前学習された中国語バイオメディカル言語モデルeHealthを紹介する。このモデルは、11の中国語バイオメディカルNLPタスクにおいて、既存の汎用的およびバイオメディカル分野向けPLMを上回り、ドメイン特化語彙と外部知識を必要としない自己教師付き学習のため、優れた性能と容易なデプロイメントを実現している。
Pre-trained language models (PLMs), such as BERT and GPT, have revolutionized the field of NLP, not only in the general domain but also in the biomedical domain. Most prior efforts in building biomedical PLMs have resorted simply to domain adaptation and focused mainly on English. In this work we introduce eHealth, a Chinese biomedical PLM built from scratch with a new pre-training framework. This new framework pre-trains eHealth as a discriminator through both token- and sequence-level discrimination. The former is to detect input tokens corrupted by a generator and recover their original identities from plausible candidates, while the latter is to further distinguish corruptions of a same original sequence from those of others. As such, eHealth can learn language semantics at both token and sequence levels. Extensive experiments on 11 Chinese biomedical language understanding tasks of various forms verify the effectiveness and superiority of our approach. We release the pre-trained model at \url{https://github.com/PaddlePaddle/Research/tree/master/KG/eHealth} and will also release the code later.
研究の動機と目的
- 汎用ドメインの対応モデルを上回る、公開可能で高品質な中国語バイオメディカル事前学習言語モデル(PLM)の不足を解消すること。
- ドメイン特化語彙と自己教師付き目的を用いてスクラッチから訓練されたPLMにより、中国語バイオメディカルテキスト理解を向上させること。
- トークンレベルとシーケンスレベルの両方の意味的特徴を捉えるために、マルチレベルテキスト特徴抽出を用いた事前学習フレームワークの開発。
- 多くの先行研究とは異なり、外部知識ベースに依存しないため、容易なデプロイメントを可能にすること。
- 広範な研究および応用利用を促進するため、公開可能で高性能な中国語バイオメディカルPLMをリリースすること。
提案手法
- ELECTRAにインspiredされたジェネレータ・ディスクラミネータフレームワークを提案。ジェネレータが入力テキストを汚染し、ディスクラミネータが元のトークンを復元し、汚染済みシーケンスと正常シーケンスを区別する。
- 局所的意味理解を強化するため、妥当な候補から汚染されたトークンを検出・復元するトークンレベル特徴抽出(RTD)を採用。
- 同じ元のシーケンスからの汚染と異なるシーケンスからの汚染を区別する対照学習を用いたシーケンスレベル特徴抽出(CSP)を導入。これにより、グローバルな文脈モデリングが向上。
- 中国語バイオメディカルテキストに特化した新規に構築されたドメイン内語彙を用いて、ディスクラミネータをスクラッチから事前学習。トークン化の正確性が向上。
- RTD、MTS(マスクされたトークン選択)およびCSPを統合したマルチタスク目的を用いて、局所的およびグローバルな意味表現を同時に最適化。
- 大規模な匿名化医療対話、電子的医療記録、教科書を用いてモデルを訓練。これにより、ドメイン特化表現学習が保証される。
実験結果
リサーチクエスチョン
- RQ1ドメイン特化語彙を用いてスクラッチから事前学習された中国語バイオメディカルPLMは、汎用ドメインまたは微調整済みモデルを上回る性能を示せるか?
- RQ2トークンレベルとシーケンスレベルの対照学習を組み合わせたマルチレベルテキスト特徴抽出は、標準的な事前学習目的と比較して、中国語バイオメディカルテキストの意味表現を向上させるか?
- RQ3汎用ドメインモデルからの継続的事前学習と比較して、ドメイン内語彙を用いてスクラッチから事前学習することの性能および効率的さはいかがなっているか?
- RQ4提案された事前学習タスク(RTD、MTS、CSP)は、個別および統合的に最終モデル性能にどの程度寄与しているか?
- RQ5外部知識に依存しない自己教師付き学習を用いたPLMは、中国語バイオメディカルNLPでSOTAの結果を達成できるか。また、下流アプリケーションへの容易なデプロイメントは可能か?
主な発見
- eHealthは、テキスト分類、マッチング、情報抽出、質問応答を含む11の中国語バイオメディカルNLPタスクでSOTA性能を達成。汎用ドメインおよびバイオメディカル分野向けPLMを上回っている。
- CBLUEベンチマーク上、標準的なELECTRA事前学習と比較して、フルマルチレベル事前学習設定(RTD + MTS + CSP)は平均0.96%の向上を達成。
- シーケンスレベル対照学習タスク(CSP)を削除すると、CBLUE上で平均0.45%の性能低下が生じるが、トークンレベルMTSタスクを削除すると、より大きな0.87%の低下が発生。
- 汎用ドメインモデルからの継続的事前学習(E weights + E vocab)と比較して、ドメイン内語彙を用いたスクラッチからの事前学習(R weights + B vocab)は、たとえ50万ステップの訓練でも優れた結果を示す。
- ドメイン内語彙と汎用ドメイン語彙の性能差は顕著である。汎用ドメイン語彙(R weights + E vocab)を用いると、CBLUEスコアは73.52%から73.30%に低下する。
- eHealthは、MC-BERT、PCL-MedBERT、SMedBERT、EMBERTを含む、より大きなモデルや既存のバイオメディカルPLMをすべての評価ベンチマークで上回り、その有効性とスケーラビリティを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。