[论文解读] Improving Multimodal Interactive Agents with Reinforcement Learning from Human Feedback
本文提出了一种框架,通过人类反馈强化学习(RLHF)提升多模态交互智能体的性能,而无需依赖程序化奖励函数。通过收集人类在模拟3D交互过程中对智能体进展的判断,并利用一种新型的时序Bradley-Terry(IBT)奖励模型进行建模,该方法采用BC+RL进行训练,在真实交互中达到人类性能的93%,部分任务甚至超过平均人类成功率。
An important goal in artificial intelligence is to create agents that can both interact naturally with humans and learn from their feedback. Here we demonstrate how to use reinforcement learning from human feedback (RLHF) to improve upon simulated, embodied agents trained to a base level of competency with imitation learning. First, we collected data of humans interacting with agents in a simulated 3D world. We then asked annotators to record moments where they believed that agents either progressed toward or regressed from their human-instructed goal. Using this annotation data we leveraged a novel method - which we call "Inter-temporal Bradley-Terry" (IBT) modelling - to build a reward model that captures human judgments. Agents trained to optimise rewards delivered from IBT reward models improved with respect to all of our metrics, including subsequent human judgment during live interactions with agents. Altogether our results demonstrate how one can successfully leverage human judgments to improve agent behaviour, allowing us to use reinforcement learning in complex, embodied domains without programmatic reward functions. Videos of agent behaviour may be found at https://youtu.be/v_Z9F2_eKk4.
研究动机与目标
- 开发一种利用人类反馈而非手工编码奖励函数来训练具身化、多模态智能体的方法。
- 解决在开放式环境中对复杂、模糊的人机交互定义精确且鲁棒的奖励函数的挑战。
- 通过人机协同反馈提升智能体在移动操作和双向语言交互任务中的表现。
- 构建一种可扩展、可泛化的框架,适用于数字助手、游戏AI和语言可指令机器人。
- 证明基于人类判断的RLHF可超越模仿学习基线,甚至在特定任务中超越平均人类表现。
提出的方法
- 在3D模拟环境(Playhouse)中收集人类-人类交互数据,通过行为克隆(BC)预训练初始智能体。
- 开展人机协同交互,参与者实时评估智能体在达成目标过程中的进展,标记出进展或退步的离散时刻。
- 提出时序Bradley-Terry(IBT)模型,从人类对智能体轨迹时间片段的判断中学习奖励函数。
- 利用IBT训练奖励模型,捕捉跨时间的细微人类偏好,实现密集且连续的反馈。
- 结合行为克隆与强化学习(BC+RL)对智能体进行微调,以优化学习到的奖励模型。
- 通过真实人类交互评估智能体,参与者实时下达指令并评定智能体的成功程度。

实验结果
研究问题
- RQ1能否有效建模人类对智能体进展的反馈,以指导复杂、多模态交互环境中的强化学习?
- RQ2基于人类判断训练的奖励模型是否能在操作和语言交互任务中,使智能体表现超越模仿学习基线?
- RQ3在开放式、自然主义的交互中,基于人类反馈的RLHF在多大程度上可实现与人类相当或更优的性能?
- RQ4如何组织人类反馈,以支持长时程、多模态任务中的密集、时间敏感的奖励建模?
- RQ5IBT模型是否能在无需完整轨迹比较的情况下,有效捕捉人类在时间维度上的偏好?
主要发现
- 采用BC+RL训练的智能体在真实交互场景中达到人类参与者的93%成功率,显著优于仅使用BC的智能体。
- 在特定交互类型(如问答和物体操作)中,BC+RL智能体的表现超过了平均人类水平。
- 时序Bradley-Terry(IBT)模型成功捕捉了人类对时间片段的反馈,实现了有效的奖励塑造,而无需完整轨迹比较。
- 该框架在多种任务中展现出良好的泛化能力,包括移动操作和双向语言交互。
- 人类评估确认,改进后的智能体在实时交互中被感知为更具能力且目标导向性更强。
- 该方法减少了对手工设计奖励函数的依赖,实现了在复杂、模糊、类真实世界环境中智能体的可扩展训练。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。