[论文解读] MemoChat: Tuning LLMs to Use Memos for Consistent Long-Range Open-Domain Conversation
MemoChat 提出了一种指令微调流程,使大型语言模型(LLMs)能够通过迭代的记忆-检索-响应循环,自动生成并使用自编写的结构化备忘录,从而在长程开放域对话中保持一致。在专家标注的基准上评估,MemoChat 显著提升了响应一致性,优于诸如 ChatGPT 和 GPT-4 等强基线模型,尤其在长程回忆和跨主题理解任务上表现突出。
We propose MemoChat, a pipeline for refining instructions that enables large language models (LLMs) to effectively employ self-composed memos for maintaining consistent long-range open-domain conversations. We demonstrate a long-range open-domain conversation through iterative "memorization-retrieval-response" cycles. This requires us to carefully design tailored tuning instructions for each distinct stage. The instructions are reconstructed from a collection of public datasets to teach the LLMs to memorize and retrieve past dialogues with structured memos, leading to enhanced consistency when participating in future conversations. We invite experts to manually annotate a test set designed to evaluate the consistency of long-range conversations questions. Experiments on three testing scenarios involving both open-source and API-accessible chatbots at scale verify the efficacy of MemoChat, which outperforms strong baselines. Our codes, data and models are available here: https://github.com/LuJunru/MemoChat.
研究动机与目标
- 为解决 LLM 在长程开放域对话中因输入上下文长度限制而难以维持上下文连贯性的问题。
- 通过使 LLM 能够在对话过程中自主创建并使用结构化备忘录,消除对外部记忆模块或检索系统依赖。
- 开发一种可扩展的、基于指令微调的流程,教导 LLM 执行三项核心任务:备忘录撰写、备忘录检索和基于备忘录的响应生成。
- 建立一个标准化的、由专家标注的评估基准,用于衡量在长程对话中的一致性,特别是跨话题转换和长时程问题上的表现。
- 证明通过有效的指令微调,微调后的开源 LLM 可在一致性基准上实现与 GPT-4 等 API 可访问模型相当甚至更优的性能。
提出的方法
- 设计一个三阶段流程——记忆、检索和响应——基于“记忆-检索-响应”循环,以结构化方式组织长程对话。
- 从公开数据集中重构特定任务的指令,用于微调 LLM,使其具备备忘录撰写(总结过往对话回合)、备忘录检索(为新查询找到相关备忘录)和基于备忘录的响应生成能力。
- 采用结构化备忘录格式(如主题 + 关键点),以提高检索准确性并减少长程上下文中的幻觉现象。
- 使用精选的指令数据,对开源 LLM(如 Vicuna、T5)和 API 可访问模型(如 ChatGPT、GPT-4)进行监督微调。
- 使用 LLM 判官在精选的专家标注测试集上评估响应一致性,该测试集包含三类长程问题:回溯性问题、连词问题和多轮话题回忆问题。
- 采用零样本和 few-shot 提示法评估基线性能,并与强基线模型如 MPC-ChatGPT 和 MemoryBank-ChatGPT 进行对比。
实验结果
研究问题
- RQ1LLM 是否能通过有效微调,自主生成并使用结构化备忘录,以在长程开放域对话中保持一致性?
- RQ2在处理需要记忆召回的长程跨主题问题时,指令微调后的 LLM 与强基线(如 ChatGPT、GPT-4)相比表现如何?
- RQ3模型规模和微调数据集大小在多大程度上影响 LLM 学习并应用基于备忘录推理的能力?
- RQ4纯 LLM 原生流程(无需外部工具)是否能达到与使用外部检索或记忆模块的系统相当的性能?
- RQ5所提出的专家标注评估集在衡量多样化长程对话场景下响应一致性方面的有效性如何?
主要发现
- 在长程问题的响应一致性方面,MemoChat 平均优于强基线模型 MPC-ChatGPT 和 MemoryBank-ChatGPT 7.0 至 19.5 分。
- MemoChat-Vicuna-13B(在 1k 个样本上微调)在回溯性问题上的响应一致性得分为 64.78,优于更大的 MemoChat-Vicuna-33B(1k)模型 3.3 分,表明在小样本数据下具有更好的泛化能力。
- 完全微调的开源模型(如使用 10k 个样本微调的 MemoChat-Vicuna-33B)在一致性方面平均优于 ChatGPT-2k 和 GPT-4,较 ChatGPT-2k 平均提升 9.7 分。
- 案例研究显示,MemoChat-ChatGPT 正确地将反垄断法与机器学习联系起来,而 ChatGPT-2k 完全误解了问题,凸显了其在跨主题推理方面的能力提升。
- MemoChat-Vicuna-33B(10k)在复杂连词问题上的 LLM 判官得分为 90,而 GPT-4 为 100,表明其在多跳推理任务上表现强劲。
- 即使仅使用 1k 个训练样本,像 MemoChat-Vicuna-13B 这类大模型在备忘录撰写和检索任务中,也比小模型高出 15–30 分,表明其具备强大的 few-shot 学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。