Skip to main content
QUICK REVIEW

[论文解读] Preferences Implicit in the State of the World

Rohin Shah, Dmitrii Krasheninnikov|arXiv (Cornell University)|Feb 12, 2019
Bayesian Modeling and Causal Inference被引用 15
一句话总结

本文提出基于过去模拟的奖励学习(RLSP),一种通过最大因果熵逆强化学习从环境初始状态推断人类偏好的算法,假设该初始状态反映了人类优化的条件。该方法无需显式奖励设计即可成功避免副作用(如打碎花瓶)并推断主动任务(如采摘苹果),表明世界状态中隐含的偏好可引导安全且目标导向的行为。

ABSTRACT

Reinforcement learning (RL) agents optimize only the features specified in a reward function and are indifferent to anything left out inadvertently. This means that we must not only specify what to do, but also the much larger space of what not to do. It is easy to forget these preferences, since these preferences are already satisfied in our environment. This motivates our key insight: when a robot is deployed in an environment that humans act in, the state of the environment is already optimized for what humans want. We can therefore use this implicit preference information from the state to fill in the blanks. We develop an algorithm based on Maximum Causal Entropy IRL and use it to evaluate the idea in a suite of proof-of-concept environments designed to show its properties. We find that information from the initial state can be used to infer both side effects that should be avoided as well as preferences for how the environment should be organized. Our code can be found at https://github.com/HumanCompatibleAI/rlsp.

研究动机与目标

  • 为解决强化学习中完整奖励函数指定的挑战,特别是避免意外副作用。
  • 利用环境初始状态的隐含优化作为人类偏好信息的来源。
  • 开发一种仅从状态本身推断偏好的方法,无需演示或人类反馈。
  • 评估初始状态是否编码了关于应避免的副作用和应执行的任务的信息。
  • 证明 RLSP 通过整合隐含的人类偏好,可提升强化学习的样本效率与安全性。

提出的方法

  • 该方法假设初始状态 $ s_0 $ 反映了人类优化的配置,意味着先前的人类行为避免了负面结果。
  • 使用最大因果熵逆强化学习(MCE-IRL)推断一个奖励函数 $ \theta_{\text{Alice}} $,以解释为何在人类行为下 $ s_0 $ 是可能的。
  • 通过模拟导致 $ s_0 $ 的可能过去轨迹,计算人类奖励 $ \theta_{\text{Alice}} $ 的最大后验估计(MAP),假设已知动力学模型和手工编码特征。
  • 通过加权和将推断出的人类奖励 $ \theta_{\text{Alice}} $ 与指定奖励 $ \theta_{\text{spec}} $ 结合,形成最终奖励 $ \theta_{\text{final}} $。
  • 机器人随后优化 $ \theta_{\text{final}} $,在任务表现与副作用避免之间取得平衡。
  • 该方法在设计用于测试副作用避免与主动任务执行推断的网格世界环境中进行了评估。

实验结果

研究问题

  • RQ1环境的初始状态是否隐含编码了关于副作用(如避免打碎花瓶)的人类偏好?
  • RQ2初始状态是否也能编码关于主动任务(如采摘苹果或为电池充电)的偏好?
  • RQ3RLSP 能在无演示的情况下,仅基于状态和已知动力学,多好地推断这些偏好?
  • RQ4在动力学未知或特征模糊时,仅从单一状态推断偏好的局限性是什么?
  • RQ5将推断出的偏好与指定奖励结合,对整体任务表现和安全性有何影响?

主要发现

  • 当环境初始状态由人类行为优化时,其隐含地包含了关于应避免的副作用和应执行的任务的人类偏好信息。
  • RLSP 有效推断出应避免打碎花瓶,即使奖励函数中未明确设定此类惩罚。
  • 该算法正确推断出靠近树的果篮隐含了采摘任务的偏好,使机器人能够据此采取行动。
  • 该方法在网格世界环境中对规划时域 $ T $ 和初始状态先验 $ s_{-T} $ 的变化表现出鲁棒性。
  • 然而,当初始状态并非人类优化的结果时(如大气中的氧气),RLSP 未能推断出相关偏好。
  • 该方法揭示了推断出的人类偏好(维持现状)与指定奖励之间存在冲突,提示需要更优的奖励组合机制或人类查询机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。