Skip to main content
QUICK REVIEW

[论文解读] Word2Vec: Optimal Hyper-Parameters and Their Impact on NLP Downstream Tasks

Tosin Adewumi, Foteini Liwicki|arXiv (Cornell University)|Mar 23, 2020
Topic Modeling参考文献 20被引用 12
一句话总结

本文通过实证方法识别出 Word2Vec 在内在(类比、WordSim)和外在 NLP 任务(命名实体识别、情感分析)中的最优超参数组合,表明性能具有任务特异性,且在超过某一阈值后,更高的向量维度反而会降低性能。令人惊讶的是,较小的语料库在下游任务中的表现优于原始的 1000 亿词模型,挑战了‘更大语料库总是产生更好词向量’的假设。

ABSTRACT

Word2Vec is a prominent model for natural language processing (NLP) tasks. Similar inspiration is found in distributed embeddings for new state-of-the-art (SotA) deep neural networks. However, wrong combination of hyper-parameters can produce poor quality vectors. The objective of this work is to empirically show optimal combination of hyper-parameters exists and evaluate various combinations. We compare them with the released, pre-trained original word2vec model. Both intrinsic and extrinsic (downstream) evaluations, including named entity recognition (NER) and sentiment analysis (SA) were carried out. The downstream tasks reveal that the best model is usually task-specific, high analogy scores don't necessarily correlate positively with F1 scores and the same applies to focus on data alone. Increasing vector dimension size after a point leads to poor quality or performance. If ethical considerations to save time, energy and the environment are made, then reasonably smaller corpora may do just as well or even better in some cases. Besides, using a small corpus, we obtain better human-assigned WordSim scores, corresponding Spearman correlation and better downstream performances (with significance tests) compared to the original model, trained on 100 billion-word corpus.

研究动机与目标

  • 识别 Word2Vec 超参数(向量维度、训练轮数、窗口大小、词汇表大小)在内在和外在 NLP 评估中的最优组合。
  • 挑战‘更大的语料库和更高的嵌入维度在下游 NLP 任务中始终表现更优’的假设。
  • 评估超参数选择对内在(类比、WordSim)和外在(命名实体识别、情感分析)评估的影响。
  • 提供证据表明,类比分数高并不强烈预示下游任务性能优异,强调需针对任务进行优化。
  • 倡导通过展示较小语料库可产生优于或等同于大规模预训练数据集的结果,实现更节能、高效的训练。

提出的方法

  • 在三个英文语料库上使用连续跳字模型和 CBOW 架构训练 Word2Vec 模型:Google 新闻(1000 亿词)、一个较小的子集(1000 亿词)以及一个新构建的较小语料库(BW)。
  • 系统性地调整四个超参数:向量维度(100 至 500)、训练轮数(5–10)、窗口大小(4、8)以及词汇表大小,同时使用分层 Softmax 和负采样。
  • 通过语义和句法类比任务(Google 类比数据集)以及 WordSim-353 测量语义相似性,评估内在性能。
  • 在命名实体识别(GMB 数据集)和情感分析(IMDb 数据集)上进行外在评估,测量 F1、精确率、召回率和准确率。
  • 使用自举重采样法并计算 95% 置信区间,以评估不同模型之间性能差异的统计显著性。
  • 使用多项式插值法,基于不同语料库中类比分数的趋势,估算最优向量维度。

实验结果

研究问题

  • RQ1Word2Vec 超参数(维度、轮数、窗口大小、词汇表大小)在内在和外在 NLP 评估中的最优组合是什么?
  • RQ2当向量维度超过某一临界点后,是否会在下游 NLP 任务中导致性能下降?
  • RQ3较小的语料库是否能在下游 NLP 任务中超越原始的 1000 亿词 Google 新闻数据集?
  • RQ4高内在类比分数在多大程度上与命名实体识别和情感分析等下游任务的高性能相关?
  • RQ5在大规模语料库和小规模高效语料库上训练的模型之间是否存在显著的性能差异,且该差异是否具有统计显著性?

主要发现

  • 在命名实体识别任务中表现最佳的 Word2Vec 模型是 BW w4s1h0 配置,在开发集上 F1 得分为 0.679,在测试集上为 0.677,优于原始的 1000 亿词模型。
  • 在情感分析任务中,SW w8s0h0 模型在开发集上取得 0.798 的 F1 得分,在测试集上为 0.799,与默认的 PyTorch 嵌入模型表现相近,且优于 1000 亿词模型。
  • 类比任务上的表现与下游任务表现无强相关性:1000 亿词模型类比分数高,但在情感分析任务中表现较差(开发集 F1 = 0.384)。
  • 当向量维度超过 300–400 时,类比任务和下游任务的性能均出现下降,表明存在性能上限。
  • 较小的 BW 语料库在 WordSim 测评中得分更高(Spearman 相关系数),且在下游任务中表现优于原始的 1000 亿词模型,情感分析任务的 F1 分数差异 95% 置信区间为 [0.274, 0.504],表明具有统计显著性。
  • 自举显著性检验确认,1000 亿词模型与 BW w4s1h0 模型在命名实体识别任务中的性能差异不具统计显著性(置信区间:[-0.008, 0.01]),但在情感分析任务中差异显著(置信区间:[0.274, 0.504]),因此拒绝原假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。