[论文解读] One-shot and few-shot learning of word embeddings
本文提出了一种仅通过微调新词的嵌入向量而冻结所有其他网络权重的方法,以实现一次学习和少样本学习的词嵌入。该方法在上下文句子和先前经验中的负样本上使用梯度下降进行训练,性能与完整微调相当,但所需数据显著减少,且对已有知识的干扰极小。
Standard deep learning systems require thousands or millions of examples to learn a concept, and cannot integrate new concepts easily. By contrast, humans have an incredible ability to do one-shot or few-shot learning. For instance, from just hearing a word used in a sentence, humans can infer a great deal about it, by leveraging what the syntax and semantics of the surrounding words tells us. Here, we draw inspiration from this to highlight a simple technique by which deep recurrent networks can similarly exploit their prior knowledge to learn a useful representation for a new word from little data. This could make natural language processing systems much more flexible, by allowing them to learn continually from the new words they encounter.
研究动机与目标
- 使深度学习系统能够仅从一个或几个例子中学习新词的含义,以模拟人类的一次学习能力。
- 解决标准词嵌入模型在初始训练后无法泛化到新词的局限性。
- 开发一种在不造成先前知识灾难性遗忘的前提下整合新词表示的方法。
- 探究预训练网络是否能利用其内部知识,从极少上下文推断出罕见或未见词的有意义表示。
提出的方法
- 冻结除新词嵌入向量外的所有网络权重,仅在训练期间更新这些向量。
- 使用随机梯度下降法,以 0.01 的学习率在包含该词的句子上进行 100 个周期的优化,以调整新词的嵌入。
- 从网络先前的经验中引入负样本,以提升泛化能力并防止对少量训练样本的过拟合。
- 采用三种策略初始化新词的嵌入:使用一个不常用的标记嵌入、零向量,或周围词嵌入的中心点。
- 将基于优化的方法与中心点基线方法和完整语料微调方法进行性能对比。
- 在 100 个新词的测试集上进行评估,测量困惑度的提升以及在未见上下文中的泛化能力。
实验结果
研究问题
- RQ1预训练的深度网络能否仅使用一个或几个句子,为新词学习到有意义的表示?
- RQ2仅微调新词的嵌入而冻结所有其他权重,是否能防止灾难性遗忘并保留已有知识?
- RQ3所提出的优化方法的性能与简单中心点初始化和完整微调相比如何?
- RQ4该方法在语义或句法上与网络已有知识一致的新词上,泛化程度如何?
主要发现
- 从中心点优化的方法在平均困惑度上比中心点基线方法提升了 64%(11 个百分点),且无任何实例表现更差。
- 配对 t 检验确认该提升具有高度显著性(t(99) = -20.5, p < 1×10⁻¹⁶)。
- 尽管仅接收 2.5% 的训练数据,该方法的性能与完整微调相当,性能差异不显著(t(99) = 0.9, p = 0.39)。
- 该方法有效利用了网络预先存在的句法和语义知识,为新词生成了上下文合适的嵌入表示。
- 该方法在各种词汇和上下文中表现出强鲁棒性,表明其不仅捕捉了语言中的简单向量平均模式,还捕捉了更深层的结构规律。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。