[论文解读] Adapting LLM Agents with Universal Feedback in Communication
本文提出了一种名为学习通信(LTC)的新颖训练范式,使大语言模型(LLM)智能体能够通过与环境及其他智能体的迭代交互,持续适应新任务。通过利用结构化的通信模式——独白(Monologue)、对话(Dialogue)和类比(Analogue)——并基于收集的轨迹进行PPO微调,LTC在决策、知识密集型推理和数值推理任务中均提升了性能,其成功率相比指令微调基线最高提升12%,且推理提示长度减少超过85%。
Recent advances in large language models (LLMs) have demonstrated potential for LLM agents. To facilitate the training for these agents with both linguistic feedback and non-linguistic reward signals, we introduce Learning through Communication (LTC). We design a universal buffer to store all the feedback, and an iterative pipeline to enable an LLM agent to explore and update its policy in an given environment. To optimize agent interactions for task-specific learning with our universal buffer and pipeline, we introduce diverse communication patterns tailored for both single-agent and multi-agent environments. We evaluate the efficacy of our LTC approach on four diverse datasets: ALFWorld (single-agent), HotpotQA (multi-agent collaboration), Chameleon (multi-agent competition), and GSM8k (multi-agent teacher-student). On these data sets, LTC outperforms the supervised instruction fine-tuning baselines by 3.6% to 12%. These results highlight the versatility and efficiency of LTC in facilitating online adaptation for LLM agents.
研究动机与目标
- 解决在极少人工监督下使LLM智能体适应新任务的挑战。
- 通过迭代交互与反馈,实现持续的、自我改进的适应。
- 减少推理过程中对长篇、手工构造的 few-shot 提示的依赖。
- 设计针对任务的通信模式,生成多样化、结构化的反馈以实现高效训练。
- 在多样化的推理与决策任务中,展示LTC范式的有效性和高效性。
提出的方法
- LTC范式采用一种在探索与训练阶段之间交替的迭代流程。
- 在探索阶段,智能体通过三种结构化的通信模式与环境及其他智能体交互:独白(自我对话)、对话(多智能体交互)和类比(从教师生成的示例中学习)。
- 交互轨迹及反馈(如奖励、错误信息)被存储在统一的经验回放缓冲区中,其中使用标记级别掩码区分系统输出、智能体输出及其他智能体输出。
- 训练阶段采用PPO算法,损失函数由语言建模损失(用于提升流畅性)和PPO损失(用于基于奖励的策略优化)组成。
- 每个探索阶段结束后更新经验回放缓冲区,并从中采样子集用于训练,从而实现持续学习。
- 该框架将每个生成的token视为强化学习设定中的动作,从而实现从交互中端到端的策略学习。

实验结果
研究问题
- RQ1LLM智能体是否能通过持续的、基于通信的学习,而非静态微调,实现更优的任务性能?
- RQ2不同的通信模式——独白、对话和类比——在多样化推理任务中如何影响学习效率与性能?
- RQ3LTC在多大程度上可减少对长篇、手工构造的few-shot提示的需求?
- RQ4通过LTC训练的小型LLM(如LLaMA-7B)是否能超越经过指令微调的大型模型(如PaLM-62B)?
- RQ5整合来自环境和教师智能体(如GPT-4)的反馈,如何影响智能体学习复杂推理模式的能力?
主要发现
- 在ALFWorld数据集中,LTC在成功率达到12%的提升,即使在具有挑战性的Pick 2任务中也优于指令微调基线。
- 在HotpotQA数据集中,LTC在EM得分上比指令微调的LLaMA-7B智能体高出5.1%,并超过指令微调的PaLM-62B模型0.6%。
- 在GSM8k数据集中,LTC相比CoT-Tuning基线准确率提升3.6%。
- 与ICL方法相比,LTC将输入提示的token数量减少了85%–90%,仅使用few-shot prompting所需token的12.8%至10.8%。
- 消融研究显示,分别对正样本和负样本使用结构化通信模式与PPO损失,相比朴素的数据采样方式,能带来更快且更显著的性能提升。
- 案例研究显示,LTC使智能体能够从反馈中学习,并避免模仿教师模型(如GPT-4)所采用的捷径,表明其学习能力超越了单纯模仿。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。