[论文解读] RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models
该论文提出Raven,一种通过检索增强的掩码语言建模和前缀语言建模来增强上下文学习的检索增强型编码器-解码器语言模型,解决了预训练-测试分布不匹配和上下文长度受限的问题。它引入了上下文融合学习(FiCL),在不微调的情况下利用更多上下文示例,尽管参数量仅为大型模型的1/180,但性能可与更大模型相媲美。
In this paper, we investigate the in-context learning ability of retrieval-augmented encoder-decoder language models. We first conduct a comprehensive analysis of existing models and identify their limitations in in-context learning, primarily due to a mismatch between pretraining and inference, as well as a restricted context length. To address these issues, we propose RAVEN, a model that combines retrieval-augmented masked language modeling and prefix language modeling. We further introduce Fusion-in-Context Learning to enhance the few-shot performance by enabling the model to leverage more in-context examples without requiring additional training. Through extensive experiments, we demonstrate that our simple yet effective design significantly improves performance, achieving results comparable to the most advanced language models in certain scenarios, despite having substantially fewer parameters. Our work underscores the potential of retrieval-augmented encoder-decoder language models for in-context learning and encourages further research in this direction.
研究动机与目标
- 探究并改进检索增强型编码器-解码器模型(特别是SOTA模型Atlas)的上下文学习能力。
- 解决阻碍Atlas少样本性能的预训练-测试分布不匹配和上下文长度受限问题。
- 开发一种无需模型微调或架构修改即可有效利用更多上下文示例的方法。
- 探究上下文示例检索在提升少样本性能中的作用。
- 证明更小的、检索增强型编码器-解码器模型可实现与远大于其规模的解码器专用模型相媲美的性能。
提出的方法
- Raven结合了检索增强型掩码语言建模和前缀语言建模,以对齐预训练和推理分布,减少预训练-测试分布不匹配。
- 上下文融合学习(FiCL)通过在解码过程中动态融合示例,使模型能够关注并整合来自更多上下文示例的信息。
- 模型在推理时利用其内部检索器检索相关上下文示例,从而提升少样本性能。
- 该架构采用双向编码器和解码器内融合机制,有效整合检索到的文本与输入上下文。
- 该方法通过在推理时依赖检索和动态融合,避免了重新训练或模型修改。
- 该方法在零样本和少样本基准(包括MMLU和NQ)上进行了评估,并对检索效果和上下文长度进行了消融研究。

实验结果
研究问题
- RQ1像Atlas这样的检索增强型编码器-解码器模型能否有效执行上下文学习?其关键局限性是什么?
- RQ2预训练-测试分布不匹配如何影响编码器-解码器模型的上下文学习性能?
- RQ3上下文融合学习(FiCL)是否能在无需额外训练或模型修改的情况下实现更好的少样本性能?
- RQ4在推理时检索相关上下文示例是否能进一步提升少样本性能?
- RQ5更小的、检索增强型编码器-解码器模型能否实现与远大于其规模的解码器专用模型相媲美的性能?
主要发现
- Raven在零样本和少样本设置下均显著优于Atlas,使用FiCL时在MMLU(11B版本)上提升了4.9个百分点。
- 在MMLU基准上,Raven-11B在5-shot学习中达到50.5%的准确率,超越了GPT-3 175B的零样本性能(43.9%),并接近PaLM 62B(69.3%)的表现。
- 通过上下文示例检索,Raven在1-shot学习中于NQ上实现了9.8%的绝对性能提升(11B模型),证明了相关示例检索的价值。
- 尽管参数量仅为GPT-3 175B的1/180,Raven-11B在MMLU上仍实现了可比的少样本性能,凸显其高效性。
- Raven-3B的零样本性能(45.7%)超过了GPT-3 175B的少样本性能(26.0%),表明其在无微调情况下具备强大的泛化能力。
- FiCL使11B模型在少样本学习中的表现优于零样本学习,逆转了标准上下文学习中常见的性能下降趋势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。