[论文解读] Introducing BEREL: BERT Embeddings for Rabbinic-Encoded Language
本文介紹了 BEREL,一個專為拉比希伯來文文本預訓練的 BERT 模型,彌補了針對此歷史性獨特語言變體的自然語言處理工具的空白。在塔木德與其他拉比文獻的大規模語料上進行訓練,BEREL 在自訂的同音異義詞消歧義挑戰數據集上表現優於一般希伯來語模型(如 HeBERT 和 AlephBert),展現其在捕捉拉比希伯來文獨特的詞形、句法與拼寫特徵方面的優越性。
We present a new pre-trained language model (PLM) for Rabbinic Hebrew, termed Berel (BERT Embeddings for Rabbinic-Encoded Language). Whilst other PLMs exist for processing Hebrew texts (e.g., HeBERT, AlephBert), they are all trained on modern Hebrew texts, which diverges substantially from Rabbinic Hebrew in terms of its lexicographical, morphological, syntactic and orthographic norms. We demonstrate the superiority of Berel on Rabbinic texts via a challenge set of Hebrew homographs. We release the new model and homograph challenge set for unrestricted use.
研究动机与目标
- 針對缺乏專門針對拉比希伯來文訓練的自然語言處理模型的問題,拉比希伯來文是具有獨特語言規範的歷史性獨特希伯來文變體。
- 彌合現代希伯來語 NLP 模型與拉比希伯來文文本專門需求之間的差距。
- 開發一個能捕捉拉比希伯來文詞典學、詞形、句法與拼寫特性的預訓練語言模型。
- 發布一個專用的同音異義詞挑戰數據集,以評估模型在拉比文本詞語歧義上的表現。
提出的方法
- 在包含塔木德及其他古典拉比文學的大型拉比希伯來文文本語料上預訓練基於 BERT 的架構。
- 在預訓練過程中使用掩碼語言建模與下一句預測目標,類似於標準 BERT。
- 利用針對拉比希伯來文特徵(如變形與拼寫)優化的領域專用分詞與子詞分割技術。
- 在精心篩選的同音異義詞消歧義任務上微調模型,以評估其在上下文中解決詞義歧義的能力。
- 以無限制許可證釋放模型權重與挑戰數據集,以支援可重現性與進一步研究。
实验结果
研究问题
- RQ1在需要深入理解古典語言結構的任務中,基於 BERT、在拉比希伯來文上預訓練的模型是否能優於一般希伯來語模型?
- RQ2針對拉比希伯來文中的同音異義詞,領域專用的預訓練模型在詞形因歷史拼寫與詞形變化而模糊的情況下,其消歧義效果如何?
- RQ3一般希伯來語模型(如 HeBERT 和 AlephBert)在多大程度上無法捕捉拉比希伯來文的句法與詞形細節?
- RQ4在低資源、歷史專用的自然語言處理任務中,訓練數據領域對下游性能有何影響?
主要发现
- BEREL 在自訂的同音異義詞消歧義挑戰數據集上顯著優於 HeBERT 和 AlephBert,展現其在上下文敏感詞義解析方面的優越性能。
- 該模型在同音異義詞基準測試中取得最優結果,表明其在捕捉拉比希伯來文詞形與句法複雜性方面的有效性。
- 同音異義詞挑戰數據集的釋放為未來針對拉比希伯來文的模型提供了標準化評估基準。
- 一般希伯來語模型與 BEREL 之間的性能差距突顯了針對歷史與宗教文本處理進行領域專用預訓練的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。