[论文解读] Exploring Swedish & English fastText Embeddings for NER with the Transformer
本文在基于Transformer的命名实体识别(NER)系统中评估了瑞典语和英语的fastText词嵌入,结果表明,经过最优超参数调优的小型语料库训练的嵌入模型在性能上优于如Common Crawl等更大的语料库。研究首次公开发布了瑞典语类比测试集,并发现子词n-gram在词形丰富的瑞典语中显著提升了性能,而尽管训练数据量更大,基于word2vec的CBoW模型在英语上表现最佳。
In this paper, our main contributions are that embeddings from relatively smaller corpora can outperform ones from larger corpora and we make the new Swedish analogy test set publicly available. To achieve a good network performance in natural language processing (NLP) downstream tasks, several factors play important roles: dataset size, the right hyper-parameters, and well-trained embeddings. We show that, with the right set of hyper-parameters, good network performance can be reached even on smaller datasets. We evaluate the embeddings at both the intrinsic and extrinsic levels. The embeddings are deployed with the Transformer in named entity recognition (NER) task and significance tests conducted. This is done for both Swedish and English. We obtain better performance in both languages on the downstream task with smaller training data, compared to recently released, Common Crawl versions; and character n-grams appear useful for Swedish, a morphologically rich language.
研究动机与目标
- 评估在较小语料库上训练的fastText词嵌入与在更大语料库(如Common Crawl)上训练的词嵌入在英语和瑞典语的命名实体识别任务中的性能表现。
- 开发并发布首个公开可用的瑞典语类比测试集,用于词嵌入的内在评估。
- 研究超参数调优对词嵌入质量及下游NER性能的影响。
- 评估字符n-gram在词形丰富的语言(如瑞典语)中相对于英语的实用性。
提出的方法
- 使用skipgram-negative sampling方法,在英语和瑞典语语料库上训练fastText词嵌入,采用n=5的字符n-gram,并调整窗口大小。
- 通过内在评估(包括类比测试和WordSim-353)以及外在评估(基于Transformer的NER模型)来评估词嵌入性能。
- 采用网格搜索法确定英语和瑞典语的最优超参数(窗口大小、负采样、子词与词级别)。
- 通过自助法(bootstrap-based)显著性检验比较不同词嵌入模型之间的性能差异。
- 使用表现最佳的词嵌入训练Transformer模型进行NER任务,并报告F1、精确率和召回率得分。
- 创建并验证一个新的瑞典语类比测试集,通过专家验证的词类比对,以支持瑞典语词嵌入的内在评估。
实验结果
研究问题
- RQ1在英语和瑞典语的下游NER任务中,基于较小语料库训练的fastText词嵌入是否能优于在更大语料库(如Common Crawl)上训练的嵌入?
- RQ2与英语相比,字符n-gram在词形丰富的语言(如瑞典语)中能多大程度上提升性能?
- RQ3通过类比和WordSim-353进行的内在评估是否能可靠预测下游NER性能?
- RQ4超参数选择(窗口大小、负采样、子词与词级别)如何影响NER中的模型性能?
- RQ5在瑞典语和英语的NER任务中,word2vec与基于子词的fastText词嵌入之间是否存在显著性能差异?
主要发现
- 在较小语料库上训练的基于子词的fastText词嵌入在瑞典语NER任务中优于基于更大Common Crawl语料库的嵌入,F1得分分别为0.591和0.492(word2vec模型)
- 在英语中,窗口大小为8、负采样为0的word2vec CBoW模型(w8s0h0)取得了最高的F1得分0.720,优于子词模型及更大规模的Common Crawl嵌入
- 瑞典语子词模型(w4s1h1)在新类比测试集中实现了74.7的Spearman等级相关系数,表明其内在质量优异
- 显著性检验显示,英语中最佳嵌入模型之间的性能差异不太可能是偶然造成的(95%置信区间:[0.0003, 0.1674]),而瑞典语中的差异未达到统计显著性(95%置信区间:[-0.3257, 0.169])
- Transformer模型在仅5个训练轮次内即实现收敛,表明其学习速度相较于以往的LSTM模型更快
- 本研究证实,仅增加语料库规模并不能保证性能提升;最优超参数对实现高性能至关重要
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。