Skip to main content
QUICK REVIEW

[论文解读] RET-LLM: Towards a General Read-Write Memory for Large Language Models

Ali Modarressi, Ayyoob Imani|arXiv (Cornell University)|May 23, 2023
Topic Modeling被引用 6
一句话总结

Ret-LLM 为大型语言模型(LLMs)引入了一个通用的读写内存模块,通过受戴维森语义启发的三元组表示(例如,<主体,关系,对象>)实现显式知识存储与检索。该框架使用微调过的 LLM 作为控制器生成内存 API 调用,支持来自多种数据源(包括数据库)的可扩展、可解释且可更新的知识存储,并在问答任务中表现出色,尤其在时间性和聚合性任务上优于零样本 LLM,即使所有必要信息均存在于上下文中。

ABSTRACT

Large language models (LLMs) have significantly advanced the field of natural language processing (NLP) through their extensive parameters and comprehensive data utilization. However, existing LLMs lack a dedicated memory unit, limiting their ability to explicitly store and retrieve knowledge for various tasks. In this paper, we propose RET-LLM a novel framework that equips LLMs with a general write-read memory unit, allowing them to extract, store, and recall knowledge from the text as needed for task performance. Inspired by Davidsonian semantics theory, we extract and save knowledge in the form of triplets. The memory unit is designed to be scalable, aggregatable, updatable, and interpretable. Through qualitative evaluations, we demonstrate the superiority of our proposed framework over baseline approaches in question answering tasks. Moreover, our framework exhibits robust performance in handling temporal-based question answering tasks, showcasing its ability to effectively manage time-dependent information.

研究动机与目标

  • 为解决当前大型语言模型(LLMs)中缺乏显式、持久记忆的问题,这些模型目前将知识隐式编码在参数中。
  • 使 LLM 能够从文本、SQL、NoSQL 和电子表格等多种来源显式存储、检索和更新知识。
  • 支持可扩展、可解释且可聚合的记忆操作,使模型能够整合多份文档中的零散事实。
  • 提升复杂问答任务的性能,特别是涉及时间上下文或多文档聚合的任务。
  • 提供模块化、基于控制器的架构,将记忆操作与 LLM 解耦,以提升可维护性和可解释性。

提出的方法

  • 该框架集成了一个语言模型(Alpaca-7B)、一个控制器和一个内存单元,控制器负责协调用户输入、LLM 和内存之间的交互。
  • 知识以三元组形式 <概念1,关系,概念2> 从文本中提取,使用微调过的 LLM,受戴维森语义启发。
  • 内存单元存储三元组及其向量嵌入,通过嵌入的 LSH 哈希实现精确匹配和模糊检索。
  • LLM 生成内存 API 以处理写入(存储)和读取(检索)操作,LLM 根据输入上下文生成 API 调用。
  • 使用指令微调结合 LoRA 进行微调,以实现参数效率,仅对输入序列的 API 生成部分应用损失。
  • 系统支持动态更新和相关事实的聚合,支持从多份文档中列出某国所有城市等任务。

实验结果

研究问题

  • RQ1能否有效将通用的读写内存模块集成到 LLM 中,以实现显式知识存储与检索?
  • RQ2基于三元组的记忆表示如何支持在多份文档和多种数据源之间实现可解释且可聚合的知识管理?
  • RQ3所提出的框架是否能提升 LLM 在问答任务中的表现,即使所需信息已存在于上下文中,但零样本模型未能正确利用?
  • RQ4该系统如何在不重新训练的情况下处理时间知识更新,例如政治领导人的变更?
  • RQ5该内存模块在多大程度上可扩展以支持非文本数据源,如 SQL 和 NoSQL 数据库?

主要发现

  • Ret-LLM 框架成功使 LLM 能够显式存储和检索知识,即使所需信息已存在于输入上下文中,也能纠正零样本设置下观察到的失败。
  • 在零样本评估中,基础 Alpaca-7B 模型尽管上下文中已包含所有必要信息,仍未能正确回答问题,而 Ret-LLM 成功从内存中检索并使用了存储的三元组。
  • 该框架在时间性问答任务中表现出色,例如识别现任美国总统,通过无需重新训练即可更新内存。
  • 基于三元组的存储方式有效实现了零散事实的聚合,例如从多份文档中整合城市列表。
  • 基于控制器的架构结合 LLM 生成的内存 API 调用,实现了 LLM 与内存单元之间无缝、可解释且模块化的交互。
  • 使用 LoRA 的实现可在单张 A6000 GPU 上高效微调,证明了在资源受限环境中的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。