Skip to main content
QUICK REVIEW

[论文解读] Decoupled Context Processing for Context Augmented Language Modeling

Zonglin Li, Ruiqi Guo|arXiv (Cornell University)|Oct 11, 2022
Topic Modeling被引用 5
一句话总结

本文提出一种解耦的编码器-解码器架构,用于上下文增强的语言建模,其中上下文编码在离线阶段完成并缓存,从而实现高效的推理。该模型在自回归语言建模和开放域问答任务上取得了具有竞争力的性能,通过预编码和基于查找的检索,实现了上下文的有基转移并降低了计算成本。

ABSTRACT

Language models can be augmented with a context retriever to incorporate knowledge from large external databases. By leveraging retrieved context, the neural network does not have to memorize the massive amount of world knowledge within its internal parameters, leading to better parameter efficiency, interpretability and modularity. In this paper we examined a simple yet effective architecture for incorporating external context into language models based on decoupled Encoder Decoder architecture. We showed that such a simple architecture achieves competitive results on auto-regressive language modeling and open domain question answering tasks. We also analyzed the behavior of the proposed model which performs grounded context transfer. Finally we discussed the computational implications of such retrieval augmented models.

研究动机与目标

  • 设计一种计算高效的架构,通过将上下文编码与序列生成解耦,实现将外部上下文整合到语言模型中。
  • 通过减少对世界知识内部记忆的依赖,提升参数效率、可解释性和模块化程度。
  • 分析检索到的上下文如何改善模型预测,特别是对内容词的影响,并验证有基的上下文迁移。
  • 评估检索增强模型的计算权衡,重点关注延迟、内存和能效。
  • 使用衡量检索上下文实用性的指标来指导检索器的训练。

提出的方法

  • 模型采用标准的编码器-解码器Transformer架构,其中编码器在离线阶段处理并编码检索到的上下文段落。
  • 上下文编码被缓存,使得在推理时可快速查找,从而将编码步骤与自回归生成过程解耦。
  • 解码器通过交叉注意力同时关注输入序列和检索到的上下文,基于两者生成目标序列。
  • 检索器使用密集向量嵌入(如DPR)在向量数据库中搜索,并通过近似最近邻搜索(如ScaNN)检索相关上下文段落。
  • 模型通过损失函数进行训练,该损失函数鼓励解码器生成基于检索到的上下文的输出,其有效性通过消融实验和分析加以验证。
  • 检索质量通过一个实用度度量进行引导,该度量评估检索到的上下文在多大程度上提升了预测准确性。

实验结果

研究问题

  • RQ1一个简单的解耦编码器-解码器架构是否能在无需复杂注意力机制的情况下,实现上下文增强语言建模的竞争力表现?
  • RQ2该模型在多大程度上依赖检索到的上下文而非内部记忆来生成答案?
  • RQ3当关键的上下文段落(包含原始输出)被移除时,模型的行为如何变化?
  • RQ4在延迟、内存和能效方面,预计算并缓存上下文编码的计算权衡如何?
  • RQ5上下文增强如何改善不同词类的预测表现,特别是内容词?

主要发现

  • 该解耦架构在C4语言建模和Natural Questions问答任务上取得了具有竞争力的结果,其比特每字节(BPB)表现优于或匹配了更复杂的基线模型(如Chunked-Cross-Attention)。
  • 76%的模型输出因原始输出所在上下文段落的移除而发生变化,但新输出仍基于剩余上下文保持有基,表明模型具有强烈的上下文依赖性。
  • 通过有基上下文迁移生成的输出准确率为51.5%,显著高于非有基输出的35.4%。
  • 从20个上下文段落中检索并生成的端到端推理延迟约为66ms,其中80%的时间用于检索和编码,且上下文编码仅需解码器时间的1/3。
  • 预计算的上下文编码通过支持快速查找显著降低了推理成本,从NVMe SSD读取每段编码耗时1.5ms,网络传输时间0.8ms。
  • 该方法显著降低了能耗和硬件成本,因为除查询编码外的大部分计算(包括编码和检索)均在通用CPU和存储设备上运行,而非加速器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。