[论文解读] Active Inverse Reward Design
本文提出主动逆向奖励设计(AIRD),通过主动选择具有信息量的查询(即比较次优奖励函数)而非仅依赖最终的代理奖励,从而改进奖励推理。通过使用逆向奖励设计(IRD)在每次设计者选择后更新对真实奖励函数的后验信念,AIRD 即使在查询使用可解释的线性特征时,也能推断出非线性的真实奖励,与原始 IRD 相比,在测试环境中的遗憾显著降低。
Designers of AI agents often iterate on the reward function in a trial-and-error process until they get the desired behavior, but this only guarantees good behavior in the training environment. We propose structuring this process as a series of queries asking the user to compare between different reward functions. Thus we can actively select queries for maximum informativeness about the true reward. In contrast to approaches asking the designer for optimal behavior, this allows us to gather additional information by eliciting preferences between suboptimal behaviors. After each query, we need to update the posterior over the true reward function from observing the proxy reward function chosen by the designer. The recently proposed Inverse Reward Design (IRD) enables this. Our approach substantially outperforms IRD in test environments. In particular, it can query the designer about interpretable, linear reward functions and still infer non-linear ones.
研究动机与目标
- 为解决逆向奖励设计(IRD)的局限性,即仅使用最终的代理奖励,无法推断次优行为偏好。
- 通过将设计过程结构化为一系列主动查询,改进序列决策中的奖励推理。
- 通过在可解释的线性奖励特征上进行查询,实现对非线性真实奖励函数的推断。
- 通过主动查询选择,收集比原始 IRD 更具信息量的反馈,从而减少测试时间的遗憾。
- 在模拟人类-模型偏好环境下评估该方法,证明其在性能上优于 IRD。
提出的方法
- AIRD 将奖励设计结构化为一系列查询,每个查询向设计者呈现一组候选奖励函数进行比较。
- 在每次设计者选择后,使用逆向奖励设计(IRD)更新对真实奖励函数的后验分布。
- 查询通过贝叶斯主动学习方法主动选择,以最大化关于真实奖励的信息量。
- 引入两种查询类型:离散查询(比较 N 个奖励函数)和特征查询(在固定其他特征权重的前提下,要求用户设定部分特征的权重)。
- 特征查询利用奖励空间的结构,无需直接评估轨迹即可推断低层级的奖励偏好。
- 该方法优化查询设计以最大化信息增益,从而实现从简单、高层级的特征比较中推断出复杂、非线性的奖励函数。
实验结果
研究问题
- RQ1主动选择奖励函数比较是否能比仅依赖最终代理奖励获得更好的奖励推理?
- RQ2对次优奖励的比较是否能提供仅从最优行为中无法获得的真实奖励信息?
- RQ3在复杂环境中,使用可解释的线性特征查询能否推断出非线性奖励函数?
- RQ4与原始 IRD 相比,主动查询选择是否能减少测试时间的遗憾?
- RQ5特征查询是否能在保持可用性的同时,实现对低层级奖励偏好的高效推断?
主要发现
- 与原始 IRD 相比,AIRD 显著降低了测试时间的遗憾,通常能完全恢复真实奖励函数。
- 通过查询次优奖励之间的偏好,AIRD 推断出最终代理奖励未捕捉到的特征偏好,例如对红眼航班的惩罚。
- 即使查询使用可解释的线性奖励特征,AIRD 仍能成功推断出非线性的真实奖励函数。
- 特征查询使用户能够在不评估轨迹的情况下调整高层级奖励权重,提升了可用性和可扩展性。
- 在模拟人类模型下,该方法在航班预订和二维导航任务中均优于 IRD。
- 主动查询选择相比被动观察最终奖励选择,能获得更高效、更具信息量的反馈。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。