Skip to main content
QUICK REVIEW

[論文レビュー] SINA-BERT: A pre-trained Language Model for Analysis of Medical Texts in Persian

Nasrin Taghizadeh, Ehsan Doostmohammadi|arXiv (Cornell University)|Apr 15, 2021
Topic Modeling参考文献 16被引用数 7
ひとこと要約

Sina-BERTは、280万件のフォーマルおよびインフォーマルなペルシャ語医療テキストを事前学習した、ペルシャ語医療自然言語処理(NLP)タスクのパフォーマンス向上を目的としたBERTベースの言語モデルである。医療質問分類、センチメント分析、質問検索のアノテート済みデータセットで微調整された結果、特に非教師あり検索において優れた性能を示し、類義的クエリで68.87%のR@1を達成した。

ABSTRACT

We have released Sina-BERT, a language model pre-trained on BERT (Devlin et al., 2018) to address the lack of a high-quality Persian language model in the medical domain. SINA-BERT utilizes pre-training on a large-scale corpus of medical contents including formal and informal texts collected from a variety of online resources in order to improve the performance on health-care related tasks. We employ SINA-BERT to complete following representative tasks: categorization of medical questions, medical sentiment analysis, and medical question retrieval. For each task, we have developed Persian annotated data sets for training and evaluation and learnt a representation for the data of each task especially complex and long medical questions. With the same architecture being used across tasks, SINA-BERT outperforms BERT-based models that were previously made available in the Persian language.

研究の動機と目的

  • 生物医学分野における高品質な事前学習済み言語モデルが不足しているという問題に対処する。
  • 事前学習用に大規模かつ多様なフォーマルおよびインフォーマルなペルシャ語医療テキストのコーパスを構築する。
  • ペルシャ語の医療NLPタスク、特に質問分類、センチメント分析、質問検索のパフォーマンスを向上させる。
  • 今後のペルシャ語医療テキストマイニング分野の研究を支援するため、アノテート済みデータセットと公開可能なモデルを提供する。
  • ドメイン特化型の事前学習が、複雑で長い医療クエリの理解を著しく向上させることを実証する。

提案手法

  • 一般ドメインのペルシャ語BERTモデルであるParsBERTの事前学習済み重みを用いてSina-BERTを初期化する。
  • Webサイト、学術誌、フォーラム、ニュースソースから収集した280万件のペルシャ語医療テキストから構成されるコーパスを用いてSina-BERTを事前学習する。
  • 医療質問分類、センチメント分析、質問検索の3つの下流タスクに対して、タスク固有のアノテート済みデータセットを用いてSina-BERTを微調整する。
  • キーワードに配慮した再ランク付けを組み込んだコントラスト学習アプローチ(Sina-BERT_kw_rcnt)を採用し、質問検索のパフォーマンスを向上させる。
  • BERTに基づく文埋め込みを用いて、医療質問間の意味的類似度を計算し、検索タスクに活用する。
  • Sina-BERTを、TF-IDF、UKP-DistilBERT、UKP-XLMR-paraphと比較し、文の埋め込みにおけるコサイン類似度を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1大規模なペルシャ語医療コーパスで事前学習されたBERTベースの言語モデルは、一般ドメインモデルと比較して、下流タスクにおけるパフォーマンスを向上させることができるか?
  • RQ2フォーマルおよびインフォーマルなペルシャ語医療テキストを用いたドメイン特化型の事前学習が、複雑で長い医療クエリの表現に与える影響は何か?
  • RQ3Sina-BERTは、特に非教師あり設定下で、既存のペルシャ語言語モデルを上回る性能を示すのか、その程度はいかほどか?
  • RQ4医療テキストに特徴的なキーワード豊富な特性が、TF-IDFや文脈的埋め込みのような検索モデルの性能に与える影響は何か?
  • RQ5Sina-BERTは、最小限のタスク固有の適応で、センチメント分析や質問分類といった多様な医療NLPタスクに一般化可能か?

主な発見

  • 類義的クエリ検索データセットにおいて、Sina-BERTは68.87%のR@1を達成し、TF-IDF(50.00%)およびUKP-DistilBERT(36.36%)を著しく上回った。
  • 質問分類タスクでは、Sina-BERTが以前のペルシャ語BERTモデルよりも高いF1スコアを達成し、構造化された医療テキスト理解の向上を示した。
  • 医療センチメント分析において、Sina-BERTはアノテート済みペルシャ語データセットで優れたパフォーマンスを示し、臨床テキストにおける微細な感情表現の捉え込みが優れていた。
  • 質問検索タスクでは、Sina-BERT_kw_rcntがすべてのベースラインを上回り、ノイズの高い状況でも優れた性能を示した。これは、実世界のシナリオにおけるロバストネスを裏付けた。
  • モデルの性能差が特に顕著に現れたのは非教師あり検索であった。これは、ドメイン特化型の事前学習が意味的理解の向上に寄与することの価値を示している。
  • 手動評価により、キーワードの重複が少ない場合でもSina-BERTが意味的に類似した質問を正しく検索していることが確認され、キーワードベースのモデルに比べて優れた文脈理解能力を有していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。