Skip to main content
QUICK REVIEW

[论文解读] The merits of Universal Language Model Fine-tuning for Small Datasets -- a case with Dutch book reviews

Benjamin van der Burgh, Suzan Verberne|arXiv (Cornell University)|Oct 2, 2019
Topic Modeling参考文献 8被引用 13
一句话总结

本文评估了在小型荷兰语图书评论数据集上使用通用语言模型微调(ULMFiT)进行情感分类的效果,结果表明,即使仅有100个手动标注的样本,ULMFiT的表现也优于传统支持向量机(SVM)。作者发布了新的110k个荷兰语图书评论数据集及一个预训练的荷兰语语言模型,结果显示ULMFiT仅需极少的标注数据即可达到约90%的准确率,证明了其在低资源自然语言处理任务中的有效迁移学习能力。

ABSTRACT

We evaluated the effectiveness of using language models, that were pre-trained in one domain, as the basis for a classification model in another domain: Dutch book reviews. Pre-trained language models have opened up new possibilities for classification tasks with limited labelled data, because representation can be learned in an unsupervised fashion. In our experiments we have studied the effects of training set size (100-1600 items) on the prediction accuracy of a ULMFiT classifier, based on a language models that we pre-trained on the Dutch Wikipedia. We also compared ULMFiT to Support Vector Machines, which is traditionally considered suitable for small collections. We found that ULMFiT outperforms SVM for all training set sizes and that satisfactory results (~90%) can be achieved using training sets that can be manually annotated within a few hours. We deliver both our new benchmark collection of Dutch book reviews for sentiment classification as well as the pre-trained Dutch language model to the community.

研究动机与目标

  • 评估ULMFiT在小型、低资源荷兰语文本数据集上进行情感分类的有效性。
  • 在不同训练集大小下,将ULMFiT的性能与传统模型(如SVM)进行比较。
  • 为荷兰语自然语言处理研究提供一个新的基准数据集和预训练语言模型。
  • 评估使用预训练语言模型进行迁移学习是否能在极少人工标注数据下实现高准确率。

提出的方法

  • 在荷兰语维基百科上预训练AWD-LSTM语言模型,以实现领域无关的表征学习。
  • 在包含二元情感标签的新110k个荷兰语图书评论数据集上微调ULMFiT分类器。
  • 使用固定的语言模型,仅对最后一层和Dropout参数进行调优,采用HpBandster优化方法。
  • 将ULMFiT与使用TF-IDF和CountVectorizer特征的LinearSVM进行比较,并对C超参数进行优化。
  • 在100至1600个样本的训练集大小范围内评估模型性能,每种大小均进行10次随机子采样以确保稳定性。
  • 使用5,000个样本的保留测试集,以确保所有实验的一致性和可比性。

实验结果

研究问题

  • RQ1ULMFiT是否能在小规模荷兰语文本数据集上,仅使用有限的标注数据,实现高情感分类准确率?
  • RQ2在低资源设置下,ULMFiT在不同训练集大小下的表现与传统模型(如SVM)相比如何?
  • RQ3来自通用领域(如维基百科)的预训练语言模型在多大程度上能泛化到特定领域任务(如图书评论)的荷兰语任务中?
  • RQ4使用迁移学习结合ULMFiT时,一个小型人工标注数据集(例如约100–1600个样本)是否能实现令人满意的表现?

主要发现

  • ULMFiT在所有训练集大小下均优于SVM,最小的ULMFiT模型(1600个样本)在全部10次随机子采样中准确率均不低于89.54%。
  • ULMFiT仅使用1,600个训练样本即超越了SVM在完整15,000个样本训练集上的表现(89.16%准确率)。
  • ULMFiT在随机子采样中的方差低于SVM,表明其在小样本数据下具有更高的模型稳定性。
  • 预训练的荷兰语语言模型使模型在极少微调下即实现高性能,表明从维基百科到图书评论任务具有强大的领域迁移能力。
  • 仅需数小时内可人工标注的小型训练集(如100–1600个样本)即可实现约90%准确率的满意性能。
  • 110k个荷兰语图书评论数据集和预训练ULMFiT模型的发布,为低资源荷兰语自然语言处理研究提供了宝贵的基准和资源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。