[论文解读] Preference Transformer: Modeling Human Preferences using Transformers for RL
本文提出 Preference Transformer,一种基于 Transformer 的架构,通过加权非马尔可夫奖励的组合来建模人类偏好,从而实现更精确且具有时间感知能力的奖励推理。该方法在使用真实人类反馈学习复杂控制行为(如 Hopper 中的双后空翻)方面优于先前方法,同时通过自注意力机制自动识别轨迹中的关键事件。
Preference-based reinforcement learning (RL) provides a framework to train agents using human preferences between two behaviors. However, preference-based RL has been challenging to scale since it requires a large amount of human feedback to learn a reward function aligned with human intent. In this paper, we present Preference Transformer, a neural architecture that models human preferences using transformers. Unlike prior approaches assuming human judgment is based on the Markovian rewards which contribute to the decision equally, we introduce a new preference model based on the weighted sum of non-Markovian rewards. We then design the proposed preference model using a transformer architecture that stacks causal and bidirectional self-attention layers. We demonstrate that Preference Transformer can solve a variety of control tasks using real human preferences, while prior approaches fail to work. We also show that Preference Transformer can induce a well-specified reward and attend to critical events in the trajectory by automatically capturing the temporal dependencies in human decision-making. Code is available on the project website: https://sites.google.com/view/preference-transformer.
研究动机与目标
- 解决基于偏好强化学习中马尔可夫奖励假设的局限性,后者无法捕捉人类决策中的时间依赖性。
- 通过将人类偏好建模为非马尔可夫奖励的加权和,提升基于偏好的强化学习的可扩展性和性能。
- 设计一种神经架构,能够通过自注意力机制推断轨迹中的关键事件并分配适当的权重。
- 实现样本高效的复杂行为学习(如多后空翻和机器人操作),仅依赖真实人类反馈。
提出的方法
- 提出一种基于非马尔可夫奖励加权和的新型偏好模型,其中每个奖励根据其在轨迹中的重要性动态加权。
- 引入一种基于 Transformer 的架构,包含堆叠的因果与双向自注意力层,用于生成非马尔可夫奖励及其重要性权重。
- 设计一种新颖的“偏好注意力”层,通过在轨迹片段上计算注意力来推断关键事件并分配动态权重。
- 将非马尔可夫奖励的加权和用作偏好预测器,并通过与人类成对比较进行训练以对齐。
- 采用双流架构:一个用于处理每个轨迹片段,另一个通过加权和计算偏好得分。
- 利用 Transformer 建模长距离依赖的能力,实现对复杂、时序延展行为的更好信用分配。
实验结果
研究问题
- RQ1与马尔可夫假设相比,非马尔可夫奖励建模方法是否能提升基于偏好的强化学习性能?
- RQ2基于 Transformer 的架构是否能有效学习轨迹中不同事件的重要性权重,以反映人类决策过程?
- RQ3所提出的方法是否能使智能体仅通过人类偏好反馈学习到如双后空翻等复杂、长时程行为?
- RQ4模型中学习到的注意力权重是否能识别并突出影响人类偏好判断的关键事件?
- RQ5在样本效率和跨多样化控制任务的泛化能力方面,该模型与先前的偏好建模方法相比表现如何?
主要发现
- Preference Transformer 仅使用 300 个真实人类反馈查询,成功在 Hopper 环境中学会执行双后空翻,而马尔可夫奖励函数则未能学习该行为。
- 该模型在 D4RL 导航与运动基准任务以及 Robomimic 机器人操作任务中均取得了最先进性能,且仅使用真实人类偏好。
- 偏好注意力层中学习到的重要性权重清晰突出了后空翻轨迹中的关键事件(如起跳与着陆阶段),与人类注意力模式一致。
- 该模型在多样化控制任务中表现出鲁棒性与泛化能力,包括具有非马尔可夫动力学和多目标目标的任务。
- 对注意力图的可视化分析证实,该模型能够捕捉时间依赖性,并为显著影响人类偏好的事件分配更高权重。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。