[论文解读] Few-Shot Representation Learning for Out-Of-Vocabulary Words
该论文提出HiCE,一种基于层次注意力的神经网络,仅通过少量上下文句和词形特征即可学习到准确的未登录词(OOV)词向量。通过将OOV词向量学习建模为少样本回归问题,并利用MAML实现快速适应,HiCE实现了最先进性能,在6-shot学习设置下,Spearman相关性相比先前方法提升了9.3%。
Existing approaches for learning word embeddings often assume there are sufficient occurrences for each word in the corpus, such that the representation of words can be accurately estimated from their contexts. However, in real-world scenarios, out-of-vocabulary (a.k.a. OOV) words that do not appear in training corpus emerge frequently. It is challenging to learn accurate representations of these words with only a few observations. In this paper, we formulate the learning of OOV embeddings as a few-shot regression problem, and address it by training a representation function to predict the oracle embedding vector (defined as embedding trained with abundant observations) based on limited observations. Specifically, we propose a novel hierarchical attention-based architecture to serve as the neural regression function, with which the context information of a word is encoded and aggregated from K observations. Furthermore, our approach can leverage Model-Agnostic Meta-Learning (MAML) for adapting the learned model to the new corpus fast and robustly. Experiments show that the proposed approach significantly outperforms existing methods in constructing accurate embeddings for OOV words, and improves downstream tasks where these embeddings are utilized.
研究动机与目标
- 为解决仅用少量训练样本学习准确OOV词向量的挑战。
- 克服仅依赖词形或仅依赖上下文的方法在捕捉罕见或未见词汇复杂语义方面的局限性。
- 开发一种能通过快速适应新语料库实现良好泛化能力的模型,以适用于新领域。
- 通过更优的OOV表示提升下游NLP任务(如命名实体识别和词性标注)的性能。
提出的方法
- 将OOV词向量学习建模为K-shot回归问题,其中模型从K个上下文句中预测目标词向量。
- 提出一种层次化上下文编码器(HiCE),利用多头自注意力机制聚合并整合多个上下文句中的信息。
- 通过字符级卷积神经网络编码器引入词形信息,以在上下文稀疏时增强表示能力。
- 采用基于任务的训练方案,每个任务模拟一个OOV词,使用大量观测样本作为目标真实词向量。
- 采用模型无关元学习(MAML)以实现预训练HiCE模型对新语料库的快速且鲁棒的适应,尤其适用于领域分布变化的场景。
- 采用对比损失端到端训练模型,使少样本推理过程中预测的词向量与真实词向量对齐。
实验结果
研究问题
- RQ1少样本回归框架能否有效利用有限上下文和词形特征,学习到准确的OOV词向量?
- RQ2基于层次注意力的架构在从多个简短上下文句中聚合和表示语义信息方面表现如何?
- RQ3MAML微调是否能提升模型在具有不同语言模式的新领域中的泛化能力?
- RQ4所提方法是否能在内在评估和下游NLP任务中均优于现有方法?
- RQ5当上下文极度有限(如仅2–4个样本)时,引入词形特征在多大程度上能提升性能?
主要发现
- 在Chimera基准的6-shot学习设置下,HiCE相比最先进方法在Spearman相关性上实现了9.3%的相对提升。
- 该模型在命名实体识别和词性标注等下游任务中显著提升了性能,证明了所学习OOV词向量具有强大的迁移能力。
- 在上下文极少时,引入词形特征能带来可测量的性能增益,尤其在2-shot和4-shot场景下表现更明显。
- MAML微调使预训练HiCE模型能更快、更鲁棒地适应新语料库,有效缩小了训练与推理领域之间的语义差距。
- 基于任务的训练方案能有效模拟真实的OOV推理场景,同时通过真实词向量提供可靠的监督信号。
- HiCE中的层次注意力机制相比简单平均或线性方法,能更有效地聚合上下文层面的语义信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。