Skip to main content
QUICK REVIEW

[论文解读] Universal Language Model Fine-Tuning with Subword Tokenization for Polish

Piotr Czapla, Jeremy Howard|arXiv (Cornell University)|Oct 24, 2018
Natural Language Processing Techniques参考文献 14被引用 8
一句话总结

本文提出了一种使用SentencePiece和通用语言模型微调(ULMFiT)的子词分词方法,以提升波兰语的语言建模性能。通过将ULMFiT与unigram子词分词相结合,该方法在PolEval'18测试集上实现了95.0的新SOTA困惑度,比第二名模型高出35%,并在低资源设置下的下游NLP任务中展现出强大的迁移学习潜力。

ABSTRACT

Universal Language Model for Fine-tuning [arXiv:1801.06146] (ULMFiT) is one of the first NLP methods for efficient inductive transfer learning. Unsupervised pretraining results in improvements on many NLP tasks for English. In this paper, we describe a new method that uses subword tokenization to adapt ULMFiT to languages with high inflection. Our approach results in a new state-of-the-art for the Polish language, taking first place in Task 3 of PolEval'18. After further training, our final model outperformed the second best model by 35%. We have open-sourced our pretrained models and code.

研究动机与目标

  • 为解决波兰语中高阶形态屈折带来的挑战,该挑战限制了标准词级嵌入和n-gram模型的有效性。
  • 将原本专为英语设计的ULMFiT适配至波兰语,通过子词分词实现波兰语语言建模的SOTA性能。
  • 通过实现有效的迁移学习,降低低资源设置(如波兰语)下下游NLP任务的数据和计算需求。
  • 用更稳健的基于子词的ULMFiT框架替代波兰语NLP中的FastText基词表示。

提出的方法

  • 采用SentencePiece的unigram子词分词方法处理波兰语的形态丰富性,从而改善OOV处理并保留语义相似性。
  • 使用ULMFiT的微调策略,在PolEval 2018语言模型数据集上训练了一个含1150个隐藏单元的4层LSTM语言模型,嵌入维度为400。
  • 采用两阶段训练流程:首先在25%的数据子集上调整超参数,然后在完整数据集上优化性能。
  • 对于大词汇量采用采样Softmax(15K样本),并因数据集规模限制而避免使用子词正则化。
  • 通过去重句子、移除稀有词元,并可选地为大写单词添加<up>控制词元的方式进行文本预处理。
  • 使用验证困惑度评估模型,并选择表现最佳的配置进行最终测试。

实验结果

研究问题

  • RQ1当与ULMFiT结合时,子词分词是否能提升形态丰富的语言(如波兰语)的语言建模性能?
  • RQ2在基于子词的波兰语语言模型中,词汇量大小如何影响困惑度和模型泛化能力?
  • RQ3尽管内存和训练成本更高,增加循环层数量是否能提升波兰语的性能?
  • RQ4文本预处理(如首字母大写处理)在波兰语语言建模中的影响有多大?
  • RQ5ULMFiT的迁移学习框架能否通过子词表示有效适配至低资源、屈折丰富的语言(如波兰语)?

主要发现

  • 经过进一步的超参数调优,表现最佳的模型在测试集上达到95.0的困惑度,显著优于第二名模型(146.7)。
  • 该模型在PolEval’18的Task 3中获得第一名,证明其在波兰语语言建模基准上达到了SOTA性能。
  • 词汇量对模型性能影响最大:较小的词汇量接近字符级建模,而更大的词汇量则会损失词干级相似性信息。
  • 在完整数据集上,四层模型优于三层模型,表明当训练数据足够时,更深的架构能更好地捕捉波兰语的形态复杂性。
  • 使用<up>词元处理首字母大写文本预处理对困惑度无显著影响,仅在10万词汇量时出现轻微下降。
  • 最终模型相比第二名模型实现了35%的相对性能提升,凸显了子词分词与ULMFiT结合在低资源、屈折丰富的语言中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。