[论文解读] Learning Human Objectives by Evaluating Hypothetical Behavior
ReQueST 是一种新颖的主动学习方法,通过轨迹优化合成有信息量的假设性智能体行为,在复杂、高维环境中高效学习人类奖励函数。通过在这些合成行为上向用户提问——聚焦于不确定性、奖励极值、安全性和新颖性——该方法在比以往方法更少的查询次数下,实现了更优的奖励模型迁移性能和安全性检测。
We seek to align agent behavior with a user's objectives in a reinforcement learning setting with unknown dynamics, an unknown reward function, and unknown unsafe states. The user knows the rewards and unsafe states, but querying the user is expensive. To address this challenge, we propose an algorithm that safely and interactively learns a model of the user's reward function. We start with a generative model of initial states and a forward dynamics model trained on off-policy data. Our method uses these models to synthesize hypothetical behaviors, asks the user to label the behaviors with rewards, and trains a neural network to predict the rewards. The key idea is to actively synthesize the hypothetical behaviors from scratch by maximizing tractable proxies for the value of information, without interacting with the environment. We call this method reward query synthesis via trajectory optimization (ReQueST). We evaluate ReQueST with simulated users on a state-based 2D navigation task and the image-based Car Racing video game. The results show that ReQueST significantly outperforms prior methods in learning reward models that transfer to new environments with different initial state distributions. Moreover, ReQueST safely trains the reward model to detect unsafe states, and corrects reward hacking before deploying the agent.
研究动机与目标
- 为解决在动态未知、奖励函数未知及存在不安全状态的环境中学习人类奖励函数的挑战,其中直接向用户查询成本高昂。
- 开发一种安全、交互式的主动学习方法,在最小化真实环境交互的同时,通过用户对假设性行为的反馈高效学习奖励模型。
- 提升奖励模型在新初始状态分布下的泛化能力与可迁移性,尤其在复杂、连续状态环境中。
- 在不部署智能体于高风险场景的前提下,早期检测并纠正奖励欺骗行为。
- 通过主动选择最具信息量的假设性行为进行标注,显著减少所需用户查询次数。
提出的方法
- ReQueST 使用初始状态的生成模型和基于离策略数据训练的前向动力学模型,合成假设性智能体轨迹。
- 采用四种采集函数生成有信息量的轨迹:不确定性最大化、奖励最大化、奖励最小化和轨迹新颖性最大化。
- 该方法通过轨迹优化生成行为,以最大化信息价值的可计算代理指标,避免难以计算的完整信息价值(VOI)计算。
- 利用用户对这些合成行为的反馈训练神经网络奖励模型,并迭代优化直至收敛。
- 随后使用该奖励模型训练基于模型的强化学习智能体,以优化学习到的奖励函数。
- 通过动力学模型和初始状态模型对轨迹进行正则化,确保查询的可理解性与现实性。
实验结果
研究问题
- RQ1通过轨迹优化进行假设性行为合成,能否显著减少学习准确奖励模型所需的用户查询次数?
- RQ2与基线方法相比,ReQueST 在初始状态分布不同的新环境中,其迁移性能如何?
- RQ3ReQueST 是否能在不依赖真实环境交互的前提下,于智能体部署前检测并纠正奖励欺骗行为?
- RQ4ReQueST 在复杂环境中安全识别并避免不安全状态的能力如何?
- RQ5在不同数据规模和领域中,不同采集函数(不确定性、奖励最大/最小、新颖性)对模型性能的贡献程度如何?
主要发现
- 在二维导航和 Car Racing 任务中,ReQueST 在迁移设置下的最终性能至少优于适配后的基线方法 2 倍,展现出更优的泛化能力。
- 在二维导航任务中,ReQueST 将 100% 的不安全状态正确识别为不安全,并实现零失败部署,而基线方法在 75% 的情况下发生失败。
- 该方法成功检测到奖励欺骗,通过识别并纠正偏离预期目标的高奖励行为,甚至在部署前即完成修正。
- 以不确定性为驱动的查询在目标区域和陷阱区域的边界聚集,提升了模型对这些区域边界的精确定义能力。
- 以奖励最大化为驱动的查询最初因奖励模型偏差而外推至目标区域之外,但在用户标注了高奖励但偏离策略的行为后得到纠正。
- 以新颖性最大化为驱动的查询探索了地图角落等代表性不足的区域,有助于模型学习目标区域和陷阱区域的空间范围。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。