[论文解读] Alternative Weighting Schemes for ELMo Embeddings
本文评估了ELMo嵌入的替代加权方案,发现仅对前两层双向语言模型(biLM)进行学习加权平均,其在多个自然语言处理(NLP)任务中的表现优于Peters等人原始提出的加权平均方法。所提方法在8个数据集中的7个上提升了性能,训练时间减少19–44%,并避免了第三层(最抽象层)带来的性能下降。
ELMo embeddings (Peters et. al, 2018) had a huge impact on the NLP community and may recent publications use these embeddings to boost the performance for downstream NLP tasks. However, integration of ELMo embeddings in existent NLP architectures is not straightforward. In contrast to traditional word embeddings, like GloVe or word2vec embeddings, the bi-directional language model of ELMo produces three 1024 dimensional vectors per token in a sentence. Peters et al. proposed to learn a task-specific weighting of these three vectors for downstream tasks. However, this proposed weighting scheme is not feasible for certain tasks, and, as we will show, it does not necessarily yield optimal performance. We evaluate different methods that combine the three vectors from the language model in order to achieve the best possible performance in downstream NLP tasks. We notice that the third layer of the published language model often decreases the performance. By learning a weighted average of only the first two layers, we are able to improve the performance for many datasets. Due to the reduced complexity of the language model, we have a training speed-up of 19-44% for the downstream task.
研究动机与目标
- 探究原始ELMo三重双向语言模型(biLM)层的加权平均是否在下游NLP任务中表现最优。
- 评估替代加权方案——单一层、拼接、固定平均以及学习加权平均的变体——在ELMo嵌入中的表现。
- 确定biLM的第三层(最后一层)是否始终有助于性能提升,或是否在某些情况下反而造成损害。
- 开发一种比原始ELMo集成方法更快、更有效的替代方案,同时保持或提升性能。
- 评估当ELMo单独使用与与其他嵌入(如GloVe)结合使用时,加权方案的影响。
提出的方法
- 作者评估了五种加权方案:仅使用第一、第二或第三biLM层;拼接全部三层;计算三层的固定平均值;以及对全部三层进行任务特定的加权平均。
- 提出并评估了一种新方案:仅对前两层biLM输出进行任务特定的加权平均,排除第三层。
- 该方法使用一个可学习的、经softmax归一化的权重向量 s ∈ ℝ³ 来计算前两层输出的加权平均,并引入一个可学习的标量 γ 用于缩放。
- 所提方法在两种模型上进行测试:使用ELMo作为唯一输入的BiLSTM-CRF模型,以及将ELMo与GloVe嵌入结合的AllenNLP模型。
- 通过测量训练和推理速度,评估计算效率,特别是当第三层被排除时的影响。
- 实验在八个基准NLP数据集上进行:CoNLL-2003 NER、SNLI、SQuAD、SICK、SST-5、CoNLL-2005句法分析、CoNLL-2003句法分析和GENIA。
实验结果
研究问题
- RQ1原始ELMo三重biLM层的加权平均是否在各类NLP任务中均表现最佳?
- RQ2ELMo biLM的第三层是否始终有益?还是在某些情况下反而会降低性能?
- RQ3是否可以通过更简单的加权方案(如仅对前两层进行学习加权平均)实现优于原始方法的性能?
- RQ4排除biLM第三层对模型性能和训练速度有何影响?
- RQ5当ELMo作为唯一输入表示时,加权方案的重要性如何?当与其它嵌入(如GloVe)结合使用时,其影响是否依然显著?
主要发现
- 在8个数据集中的7个上,仅使用ELMo biLM的第二层表现优于第三层,表明最抽象的表示并非总是最优。
- 仅对前两层进行学习加权平均的方案在8个数据集中的7个上优于原始方法,且在多个任务中表现出统计显著的性能提升。
- 所提方法在各类模型中将训练时间减少了19–44%,其中SNLI模型的加速最大(44%),而句法分析模型的加速最小(19%)。
- 当ELMo作为唯一输入时,加权方案对性能有显著影响;但当与GloVe嵌入结合使用时,不同方案之间的性能差异变小,且通常不具统计显著性。
- 在许多情况下,第三层biLM具有负面影响,其排除可提升性能,可能是因为原始学习加权方案强制使用全部三层,包括可能具有破坏性的层。
- 固定平均与全部三层的加权平均在性能上差异可忽略,表明简单平均已接近学习复杂权重的效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。