[论文解读] The Web Can Be Your Oyster for Improving Large Language Models
本文提出UniWeb,一种统一的网页增强框架,通过动态查询Google搜索获取最新、全面的知识,以增强大型语言模型(LLMs)的能力。该方法引入了自适应搜索引擎辅助学习,以减少噪声检索;同时采用持续知识学习,使检索到的网络内容与模型内部知识对齐,显著优于先前的检索增强方法,在16项知识密集型任务中表现卓越。
Large language models (LLMs) encode a large amount of world knowledge. However, as such knowledge is frozen at the time of model training, the models become static and limited by the training data at that time. In order to further improve the capacity of LLMs for knowledge-intensive tasks, we consider augmenting LLMs with the large-scale web using search engine. Unlike previous augmentation sources (e.g., Wikipedia data dump), the web provides broader, more comprehensive and constantly updated information. In this paper, we present a web-augmented LLM UNIWEB, which is trained over 16 knowledge-intensive tasks in a unified text-to-text format. Instead of simply using the retrieved contents from web, our approach has made two major improvements. Firstly, we propose an adaptive search engine assisted learning method that can self-evaluate the confidence level of LLM's predictions, and adaptively determine when to refer to the web for more data, which can avoid useless or noisy augmentation from web. Secondly, we design a pretraining task, i.e., continual knowledge learning, based on salient spans prediction, to reduce the discrepancy between the encoded and retrieved knowledge. Experiments on a wide range of knowledge-intensive tasks show that our model significantly outperforms previous retrieval-augmented methods.
研究动机与目标
- 通过整合来自网络的动态、最新信息,解决大型语言模型(LLMs)中静态、过时知识的局限性。
- 减少对维基百科等静态知识源的依赖,这些源内容不完整且无法实时更新。
- 开发一个统一的多任务框架,有效利用网络检索支持多样化的知识密集型任务。
- 通过一种新型预训练任务,最小化模型内部知识与检索到的网络知识之间的差异。
- 实现基于置信度的有选择性网络检索,避免噪声并提高可靠性。
提出的方法
- 采用文本到文本的格式,统一16项多样化的知识密集型任务,实现联合训练。
- 实施一种自适应搜索引擎辅助学习方法,仅当大型语言模型的预测置信度较低时才触发网络检索,基于熵的自我评估实现。
- 使用商用搜索引擎(Google Search)作为检索器,以获取广泛、实时且全面的网络内容。
- 设计一种名为“持续知识学习”的预训练任务,训练模型预测检索到的网络文档中关键掩码片段,使外部知识与内部表征对齐。
- 通过统一的提示结构将检索到的网络段落整合到模型输入中,实现端到端生成并利用外部证据。
- 采用领域微调与检索到的网络数据上的持续知识学习相结合的方式,进行端到端训练。
实验结果
研究问题
- RQ1动态网络检索是否能超越维基百科等静态知识源,在知识密集型任务中提升大型语言模型的性能?
- RQ2如何使大型语言模型仅在必要时才查询网络,以避免噪声并降低计算成本?
- RQ3何种预训练策略能有效减少模型内部知识与检索到的网络知识之间的分布差异?
- RQ4统一框架是否能有效利用网络增强的大型语言模型处理多样化知识密集型任务?
- RQ5检索到的搜索结果质量如何影响模型性能?最优检索深度应如何选择?
主要发现
- UniWeb在16项知识密集型任务中显著优于先前的检索增强方法,展现出最先进性能。
- 在实时问答基准(如RealTime QA)上,模型准确识别出‘克罗地亚和摩洛哥’为2022年世界杯决赛参赛国,而静态源因内容过时而失败。
- 使用前6至10项搜索结果可达到与前1至5项相当的性能,支持选择K=10以平衡成本与效果。
- 通过预测熵进行自我评估,与模型置信度呈强相关性,正确预测的平均熵更低。
- 持续知识学习预训练任务有效减少了编码知识与检索知识之间的差异,提升了对齐性与泛化能力。
- 模型对噪声或低质量结果具有鲁棒性,尤其在结合置信度驱动的检索门控机制时表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。