[论文解读] Learning Shared Safety Constraints from Multi-task Demonstrations
本文提出多任务逆向约束学习(MT-ICL),一种利用多任务中多样化专家示范来更稳健地学习共享安全约束的方法,相较于单任务方法更具优势。通过将逆向约束学习建模为零和博弈,并利用多任务数据避免过度保守的约束,该方法在连续控制环境中成功恢复了真实的安全约束,且无需与环境交互即可达到专家水平的性能。
Regardless of the particular task we want them to perform in an environment, there are often shared safety constraints we want our agents to respect. For example, regardless of whether it is making a sandwich or clearing the table, a kitchen robot should not break a plate. Manually specifying such a constraint can be both time-consuming and error-prone. We show how to learn constraints from expert demonstrations of safe task completion by extending inverse reinforcement learning (IRL) techniques to the space of constraints. Intuitively, we learn constraints that forbid highly rewarding behavior that the expert could have taken but chose not to. Unfortunately, the constraint learning problem is rather ill-posed and typically leads to overly conservative constraints that forbid all behavior that the expert did not take. We counter this by leveraging diverse demonstrations that naturally occur in multi-task settings to learn a tighter set of constraints. We validate our method with simulation experiments on high-dimensional continuous control tasks.
研究动机与目标
- 解决难以手动指定的隐式、任务无关安全约束的学习挑战。
- 克服逆向约束学习固有的病态性,该问题常导致过度保守的约束。
- 通过利用多任务中多样化示范,提升约束的泛化能力和鲁棒性。
- 形式化多任务逆向约束学习的扩展,以实现在未见任务上安全且高性能的策略。
- 在高维连续控制任务上验证该方法,证明其无需与真实环境交互即可恢复真实安全约束。
提出的方法
- 将逆向约束学习(ICL)形式化为两名玩家之间的零和博弈:策略玩家(在约束下最大化任务奖励)与约束玩家(选择相对于专家惩罚策略的约束)。
- 通过引入一个在多个特定任务的策略玩家之间评估约束的约束玩家,将ICL扩展到多任务设置,利用专家和学习者数据的聚合,避免退化解。
- 在内层循环中使用约束强化学习(CRL)的预言机,以找到候选约束下的最优策略,从而实现安全的策略优化。
- 利用多任务示范数据提升状态空间的覆盖范围,减少在单个任务中对专家行为特异性的过拟合。
- 训练一个深度神经网络来表示约束函数,以实现在复杂、高维环境中的泛化能力。
- 通过博弈论优化过程迭代优化约束,收敛至仅禁止专家所避免的高奖励、不安全行为的约束。

实验结果
研究问题
- RQ1与单任务ICL相比,多任务示范是否能提升所学习安全约束的鲁棒性和泛化能力?
- RQ2所提出的多任务ICL框架如何避免先前ICL方法中常见的过度保守约束?
- RQ3该方法在无需与真实环境交互的情况下,能在多大程度上恢复连续控制环境中的真实安全约束?
- RQ4通过从多样化任务示范中学习共享约束,该方法能否泛化到未见任务?
- RQ5专家行为次优性对约束学习有何影响?该方法在噪声示范下是否仍保持鲁棒性?
主要发现
- 多任务ICL方法仅使用专家示范,在AntMaze环境中成功恢复了真实迷宫结构,且无需任何环境交互。
- 在AntMaze任务中,多任务约束网络(g)/(h)近似恢复了真实墙壁,而单任务网络(d)和集成方法(e)/(f)则学习到了虚假且错误的约束。
- 该方法在AntMaze环境的全部10项任务中均实现了专家水平的性能和约束违规率,结果基于3个随机种子平均,标准误已计算。
- 即使在存在噪声的专家示范(动作上添加高斯噪声)的情况下,该方法仍能保持安全且高性能的策略,展现出对次优专家的鲁棒性。
- 通过从多任务数据中学习共享约束,该方法可泛化到未见任务,如在不同导航目标下表现出一致的性能。
- 零和博弈建模实现了稳定的约束学习,在模拟和连续控制设置中均观察到迭代过程中的收敛。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。