[论文解读] Evaluation of Transfer Learning for Polish with a Text-to-Text Model
本文介紹了 plT5,一個基於多語言 T5 的文本到文本模型,專為波蘭語微調而設計,利用 mT5 的遷移學習技術,並在多樣化的波蘭語語料庫上採用去噪預訓練目標。該模型在波蘭語自然語言處理任務中建立了新的基線,包含原始的摘要與問答數據集,並在 KLEJ、翻譯與問答任務中表現出最優性能,僅在摘要任務中略遜於 plBART。
We introduce a new benchmark for assessing the quality of text-to-text models for Polish. The benchmark consists of diverse tasks and datasets: KLEJ benchmark adapted for text-to-text, en-pl translation, summarization, and question answering. In particular, since summarization and question answering lack benchmark datasets for the Polish language, we describe their construction and make them publicly available. Additionally, we present plT5 - a general-purpose text-to-text model for Polish that can be fine-tuned on various Natural Language Processing (NLP) tasks with a single training objective. Unsupervised denoising pre-training is performed efficiently by initializing the model weights with a multi-lingual T5 (mT5) counterpart. We evaluate the performance of plT5, mT5, Polish BART (plBART), and Polish GPT-2 (papuGaPT2). The plT5 scores top on all of these tasks except summarization, where plBART is best. In general (except for summarization), the larger the model, the better the results. The encoder-decoder architectures prove to be better than the decoder-only equivalent.
研究动机与目标
- 評估在統一文本到文本框架下,遷移學習對波蘭語的成效。
- 透過構建並發布新數據集,解決波蘭語在摘要與問答任務中缺乏基線數據集的問題。
- 利用來自 mT5 的遷移學習技術,開發並預訓練一個單語波蘭語 T5 模型(plT5),以提升下游任務的表現。
- 在多項自然語言處理任務中,將 plT5 與現有的波蘭語模型(plBART、papuGaPT2)及 mT5 進行比較。
- 展示從多語言檢查點初始化單語模型的效率與有效性。
提出的方法
- 在包含維基百科、NKJP、Wolne Lektury、Open Subtitles 和 Common Crawl 的多種波蘭語文本語料庫混合數據上,使用去噪自編碼目標(片段破壞)預訓練 plT5。
- 透過複製共享詞符號並對未登錄詞符號的嵌入進行平均,從 mT5 初始化模型權重。
- 在 25% 的代表性波蘭語文本上訓練 sentencepiece unigram tokeniser,建立一個 50k 維度的子詞分詞器。
- 在四項任務上微調 plT5:文本到文本的 KLEJ 基準、英波翻譯、摘要與問答。
- 所有任務均使用相同的訓練與解碼程序,利用文本到文本架構實現統一的模型應用。
- 使用標準指標評估性能:分類任務使用準確率,翻譯任務使用 BLEU,摘要任務使用 ROUGE,問答任務使用精確匹配/F1。
实验结果
研究问题
- RQ1plT5 在多樣化的波蘭語自然語言處理任務中,與 mT5 及其他專為波蘭語設計的模型(plBART、papuGaPT2)相比表現如何?
- RQ2從多語言 T5 模型遷移學習是否能在僅需最少領域特定預訓練的情況下,於單語波蘭語任務中取得優異表現?
- RQ3模型規模對波蘭語不同自然語言處理任務表現的影響為何?
- RQ4在波蘭語情境下,編碼器-解碼器架構(如 T5)與僅解碼器模型(如 GPT-2)相比表現如何?
- RQ5為摘要與問答任務構建的新基線數據集在多大程度上提升了評估的一致性與可重現性?
主要发现
- 在 KLEJ 基準、英波翻譯與問答任務中,plT5 在所有評估模型中表現最佳。
- 在摘要任務中,plBART 優於 plT5,表明模型架構的選擇對此任務至關重要。
- 在所有任務中,較大模型規模(base 與 large)均持續優於較小變體,僅在摘要任務中性能差距較不明顯。
- 在所有任務中,編碼器-解碼器模型(plT5、plBART)顯著優於僅解碼器模型(papuGaPT2),僅在摘要任務中例外。
- 從 mT5 的遷移學習方法實現了高效的預訓練,並取得優異表現,驗證了從多語言檢查點初始化單語模型的有效性。
- 作者發布了針對波蘭語摘要與問答任務的新基線數據集,公開可用,有利於未來研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。