[论文解读] Efficient Non-parametric Estimation of Multiple Embeddings per Word in Vector Space
该论文提出了多义性跳跃-gram模型(MSSG)及其非参数变体NP-MSSG,通过在训练过程中动态将上下文向量分配给最接近的语义向量,联合学习每个词类别的多个词嵌入。该方法在词在上下文中的相似性(SCWS)和WordSim-353任务上达到最先进性能,仅用不到6小时即可在近10亿词符的语料上完成训练,相比以往工作展现出更高的可扩展性与语义感知表示能力。
There is rising interest in vector-space word embeddings and their use in NLP, especially given recent methods for their fast estimation at very large scale. Nearly all this work, however, assumes a single vector per word type ignoring polysemy and thus jeopardizing their usefulness for downstream tasks. We present an extension to the Skip-gram model that efficiently learns multiple embeddings per word type. It differs from recent related work by jointly performing word sense discrimination and embedding learning, by non-parametrically estimating the number of senses per word type, and by its efficiency and scalability. We present new state-of-the-art results in the word similarity in context task and demonstrate its scalability by training with one machine on a corpus of nearly 1 billion tokens in less than 6 hours.
研究动机与目标
- 通过为每个词类别的多个语义特定向量进行学习,解决词嵌入中的多义性问题,克服单向量表示的局限性。
- 联合执行词义区分与嵌入学习,相比两步聚类与微调方法,提升准确性。
- 实现对每个词类别的语义数量的非参数估计,避免固定语义数的假设。
- 实现高可扩展性与高效性,使在大规模语料(如10亿词符)上训练仅需单机不到6小时。
- 与先前的多表示模型相比,展示在词相似性与类比任务上的性能提升。
提出的方法
- 通过为每个词类别维护多个向量,扩展跳跃-gram模型,在在线训练过程中仅基于上下文平均更新最接近的语义向量。
- 在梯度更新期间,利用上下文词向量的平均值,为给定标记选择最相关的语义向量。
- 在NP-MSSG中采用设施选址机制,以与最近现有语义的距离成比例的概率创建新聚类(语义)。
- 通过非参数方式估计每个词类别的语义数量,当上下文向量与现有语义向量的距离足够远时,动态添加新的语义向量。
- 在端到端的在线、随机优化框架中训练所有参数,实现对大规模语料的可扩展性。
- 将该方法应用于学习前30,000个最频繁词的多个嵌入,通过调整嵌入维度与语义数量以优化性能。
实验结果
研究问题
- RQ1联合学习词义区分与嵌入表示是否能提升在词在上下文中的相似性任务上的性能?
- RQ2非参数方法能否在无需先验假设的情况下自动发现每个词类别的适当语义数量?
- RQ3与以往的两步方法相比,该方法在大规模语料(如10亿词符)上是否具备高效的可扩展性?
- RQ4该模型在词相似性与类比任务上的性能与先前最先进模型相比如何?
- RQ5在存在噪声的情况下,该方法在为高频词学习多个嵌入时是否仍能保持鲁棒性?
主要发现
- MSSG模型在SCWS任务上使用avgSimC指标取得69.3%的新最先进成绩,超越先前最先进水平的65.7%。
- 在WordSim-353任务上,MSSG在avgSim指标上达到71.2%,优于先前用于多表示学习的神经网络模型。
- NP-MSSG模型为每个词学习可变数量的语义,其分布如图3所示,表明非参数语义发现的有效性。
- 该模型在单机上训练近10亿词符耗时不足6小时,相比以往方法(需一周)实现27倍加速。
- 在Google类比任务上,MSSG与NP-MSSG达到64%的准确率,显著优于先前方法(12%),并接近跳跃-gram模型的67%。
- 性能随更高嵌入维度提升,MSSG在300维时于SCWS任务上达到69.2%的avgSimC,证明其可扩展性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。