[论文解读] Motif: Intrinsic Motivation from Artificial Intelligence Feedback
Motif 通过在事件描述上获取偏好,从大型语言模型(LLMs)中推导出内在奖励信号,使智能体能够在无演示的丰富稀疏奖励环境(如 NetHack)中学习。令人惊讶的是,仅使用 Motif 内在奖励训练的智能体表现优于直接使用环境稀疏奖励训练的智能体,而将两者结合则在以往难以解决的任务上达到了最先进性能。
Exploring rich environments and evaluating one's actions without prior knowledge is immensely challenging. In this paper, we propose Motif, a general method to interface such prior knowledge from a Large Language Model (LLM) with an agent. Motif is based on the idea of grounding LLMs for decision-making without requiring them to interact with the environment: it elicits preferences from an LLM over pairs of captions to construct an intrinsic reward, which is then used to train agents with reinforcement learning. We evaluate Motif's performance and behavior on the challenging, open-ended and procedurally-generated NetHack game. Surprisingly, by only learning to maximize its intrinsic reward, Motif achieves a higher game score than an algorithm directly trained to maximize the score itself. When combining Motif's intrinsic reward with the environment reward, our method significantly outperforms existing approaches and makes progress on tasks where no advancements have ever been made without demonstrations. Finally, we show that Motif mostly generates intuitive human-aligned behaviors which can be steered easily through prompt modifications, while scaling well with the LLM size and the amount of information given in the prompt.
研究动机与目标
- 使智能体能够在无需事先任务特定奖励设计的情况下,探索并学习复杂、开放式的环境。
- 弥合 LLM 所提供的高层常识与智能体低层次感知运动决策之间的差距。
- 开发一种可扩展的、通用的内在动机方法,利用 LLM 而避免直接策略监督。
- 评估由 LLM 衍生的内在奖励是否能在具有挑战性的环境中引导出与人类对齐且可泛化的行为。
- 研究该方法在不同 LLM 大小、提示信息量和数据集多样性下的鲁棒性与可扩展性。
提出的方法
- 收集在 NetHack 环境中不同性能水平智能体生成的多样化观察数据集。
- 从观察中生成粗粒度的事件描述,以描述关键环境事件。
- 使用预训练的 LLM(例如 Llama 2)对描述进行成对偏好判断,指示哪个事件更可取。
- 将 LLM 的偏好信号蒸馏为适用于强化学习的密集、可微分的内在奖励函数。
- 使用 PPO 或类似强化学习算法训练智能体,以最大化内在奖励,或将其与环境的稀疏奖励相结合。
- 通过修改 LLM 的指令提示实现基于提示的策略引导,从而控制内在奖励的语义。

实验结果
研究问题
- RQ1LLM 能否为强化学习智能体在 NetHack 等稀疏奖励、开放式环境中提供有效的内在奖励?
- RQ2仅使用 LLM 衍生的内在奖励训练的智能体是否优于直接使用环境稀疏外在奖励训练的智能体?
- RQ3内在奖励的性能如何随 LLM 大小和提示信息量的变化而变化?
- RQ4该方法对收集轨迹的数据集多样性以及轨迹性能水平变化的鲁棒性如何?
- RQ5内在奖励会引发哪些行为特征?这些特征是否可通过提示工程进行调控?
主要发现
- 仅使用 Motif 内在奖励训练的智能体,其在 NetHack 上的平均得分高于直接使用环境稀疏奖励信号训练的智能体。
- 当与环境奖励结合使用时,Motif 显著优于现有方法,并在以往无演示无法解决的“神谕任务”上取得进展。
- Motif 生成的行为在定性上与人类游戏行为一致,展现出前瞻性和常识推理特征。
- 该方法在 LLM 大小和提示信息量方面均表现出有利的可扩展性,即使 LLM 更大或提示更详细,性能依然稳健。
- 即使训练数据集被限制在低回报或多样性较低的轨迹上,内在奖励仍保持有效,仅在极端数据剪枝(例如 ≤100k 对)时性能出现下降。
- 观察到一种新现象——组合性错位,即内在与外在奖励的联合优化导致行为与任务奖励产生错位。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。