[论文解读] Unbounded cache model for online language modeling with open vocabulary
本文提出了一种无界缓存模型,通过利用过去隐藏激活的非参数记忆,动态适应新数据分布,从而增强预训练语言模型。通过采用近似最近邻搜索和量化技术,该模型能够从数百万个存储的表征中高效检索相关上下文,在分布外设置下,与静态模型相比,困惑度最高降低69.7%。
Recently, continuous cache models were proposed as extensions to recurrent neural network language models, to adapt their predictions to local changes in the data distribution. These models only capture the local context, of up to a few thousands tokens. In this paper, we propose an extension of continuous cache models, which can scale to larger contexts. In particular, we use a large scale non-parametric memory component that stores all the hidden activations seen in the past. We leverage recent advances in approximate nearest neighbor search and quantization algorithms to store millions of representations while searching them efficiently. We conduct extensive experiments showing that our approach significantly improves the perplexity of pre-trained language models on new distributions, and can scale efficiently to much larger contexts than previously proposed local cache models.
研究动机与目标
- 解决预训练语言模型在无需微调的情况下适应快速变化或分布外数据分布的挑战。
- 克服局部缓存模型受限于小上下文窗口(数千个标记)的局限性。
- 通过存储并检索数百万个过去隐藏激活的非参数记忆系统,实现实时、可扩展的适应。
- 在保持原始预训练分布一致性的同时,提升模型在新分布或罕见分布上的性能。
提出的方法
- 将语言模型的所有过去隐藏激活存储在非参数记忆组件中,以实现动态检索。
- 使用带量化的近似最近邻(ANN)搜索(IFVPQ)从大规模记忆中高效检索相关表征。
- 将检索到的表征与参数化模型的预测结果结合,生成动态、上下文感知的概率分布。
- 将缓存机制集成到循环神经网络语言模型中,无需微调即可实现实时适应。
- 利用查询表征与存储激活之间的相似性,检索语义相关的过去序列,以提升下一个词的预测性能。
- 通过优化的ANN索引和量化技术,使系统可扩展至处理数百万个存储表征,同时保持低推理延迟。
实验结果
研究问题
- RQ1基于过去隐藏状态的非参数记忆是否能显著提升预训练语言模型在分布外或快速变化数据分布上的性能?
- RQ2在不同数据领域中,无界缓存模型与局部缓存模型及静态模型在困惑度上的表现相比如何?
- RQ3增加最近邻数量和缓存大小对模型性能与推理效率有何影响?
- RQ4结合量化的近似最近邻搜索是否能实现在大规模记忆中可扩展、实时的检索,同时不损失准确性?
主要发现
- 当从新闻领域迁移到书籍领域(高度不同的分布)时,无界缓存模型在平均困惑度上降低了69.7%。
- 在远距离领域迁移任务中(例如,从新闻到维基),无界缓存模型相比静态模型实现了79.7%的相对改进,相比单频基线模型实现了51.6%的改进。
- 在近域迁移任务中(例如,新闻2007年到2008–2011年),无界缓存模型相比静态模型实现了20.44%的困惑度降低,而单频基线和局部缓存模型仅带来微小收益。
- 在领域内测试数据(新闻2007年)上,与静态模型相比,该模型实现了24.6%的困惑度降低,证明其通过非线性检索增强了判别能力。
- 随着最近邻数量的增加,性能持续提升,1,000个最近邻在速度与准确率之间提供了有利的权衡,因其具有线性复杂度。
- 随着测试集规模增大,缓存仍能持续提升性能,原因在于对罕见词积累了高质量的表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。