Skip to main content
QUICK REVIEW

[論文レビュー] Introducing BEREL: BERT Embeddings for Rabbinic-Encoded Language

Avi Shmidman, Joshua Guedalia|arXiv (Cornell University)|Aug 3, 2022
Natural Language Processing Techniques被引用数 5
ひとこと要約

この論文では、歴史的に特異な言語的特徴を持つラビニックヘブライ語テキストに特化して事前学習されたBERTベースの言語モデル、BERELを紹介する。タラムおよびラビニック文献の大量コーパスを用いて学習されたBERELは、一般のヘブライ語モデル(HeBERT や AlephBert)と比較して、独自の語彙的・屈折的・構文的・表記的特徴を捉える能力に優れ、語義の曖昧さを解消するタスクで優れた性能を示した。

ABSTRACT

We present a new pre-trained language model (PLM) for Rabbinic Hebrew, termed Berel (BERT Embeddings for Rabbinic-Encoded Language). Whilst other PLMs exist for processing Hebrew texts (e.g., HeBERT, AlephBert), they are all trained on modern Hebrew texts, which diverges substantially from Rabbinic Hebrew in terms of its lexicographical, morphological, syntactic and orthographic norms. We demonstrate the superiority of Berel on Rabbinic texts via a challenge set of Hebrew homographs. We release the new model and homograph challenge set for unrestricted use.

研究の動機と目的

  • ラビニックヘブライ語に特化して事前学習されたNLPモデルの不足を補うため、歴史的に特異なヘブライ語の変種であるラビニックヘブライ語に特化したNLPツールの開発。
  • 現代ヘブライ語のNLPモデルと、ラビニックヘブライ語テキストに特化した要件とのギャップを埋めるための研究。
  • ラビニックヘブライ語の語彙的・屈折的・構文的・表記的特徴を的確に捉える事前学習済み言語モデルの開発。
  • ラビニックテキストにおける語彙的曖昧さの評価を目的とした、専用のベンチマークチャレンジセットの公開。

提案手法

  • タラムやその他の古典的ラビニック文献を含む、ラビニックヘブライ語テキストの大規模コーパスを用いて、BERTアーキテクチャを事前学習。
  • 標準的なBERTと同様に、マスクされた言語モデル化と次文予測の目的関数を事前学習段階で使用。
  • ラビニックヘブライ語の屈折的および表記的特徴に適合した、ドメイン特化型のトークン化とサブワード分割を活用。
  • 文脈に応じた語義の曖昧さ解消能力を評価するため、キュレートされた語彙的曖昧さ解消タスクでモデルを微調整。
  • モデル重みとチャレンジセットを無制限ライセンスで公開し、再現性と今後の研究を支援。

実験結果

リサーチクエスチョン

  • RQ1ラビニックヘブライ語で事前学習されたBERTベースのモデルは、古典的言語構造の深い理解を要するタスクにおいて、一般のヘブライ語モデルを上回る性能を示せるか?
  • RQ2歴史的表記法と屈折的特徴により語形が曖昧なラビニックヘブライ語において、ドメイン特化型の事前学習モデルは語彙的曖昧さの解消にどの程度効果的か?
  • RQ3HeBERT や AlephBert といった一般のヘブライ語モデルは、ラビニックヘブライ語の構文的・屈折的ニュアンスをどの程度捉えられていないか?
  • RQ4低リソースで歴史的・専門的特化型NLPタスクにおいて、学習データのドメインが下流タスクのパフォーマンスに与える影響は何か?

主な発見

  • BERELは、独自に構築した語彙的曖昧さ解消チャレンジセットにおいて、HeBERT や AlephBert を顕著に上回り、文脈依存的な語義解釈の能力に優れていることが示された。
  • モデルは語彙的曖昧さベンチマークで最先端の結果を達成しており、ラビニックヘブライ語の屈折的および構文的複雑さを的確に捉えていることが裏付けられた。
  • 語彙的曖昧さチャレンジセットの公開により、今後のラビニックヘブライ語を対象としたモデル開発の標準化された評価ベンチマークが提供された。
  • 一般のヘブライ語モデルとBERELとの間のパフォーマンス格差は、歴史的・宗教的テキスト処理においてドメイン特化型事前学習の重要性を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。