[论文解读] Parenting: Safe Reinforcement Learning from Human Input
本文提出 Parenting 算法,一种受人类育儿启发的安全强化学习框架,结合人类干预、偏好反馈与直接策略学习,以防止奖励欺骗、危险探索及负面副作用。通过引入一种新颖的成熟化过程,智能体能够随时间推移超越其父策略,同时保持安全性并推广至新环境。
Autonomous agents trained via reinforcement learning present numerous safety concerns: reward hacking, negative side effects, and unsafe exploration, among others. In the context of near-future autonomous agents, operating in environments where humans understand the existing dangers, human involvement in the learning process has proved a promising approach to AI Safety. Here we demonstrate that a precise framework for learning from human input, loosely inspired by the way humans parent children, solves a broad class of safety problems in this context. We show that our Parenting algorithm solves these problems in the relevant AI Safety gridworlds of Leike et al. (2017), that an agent can learn to outperform its parent as it "matures", and that policies learnt through Parenting are generalisable to new environments.
研究动机与目标
- 解决强化学习中的关键人工智能安全问题,包括危险探索、奖励欺骗、负面副作用及不安全中断。
- 开发一种框架,使人类能够在不依赖精确指定奖励函数的情况下参与自主智能体的训练。
- 克服基于偏好的奖励建模的局限性,后者可能因分布偏移模糊性而需针对任务调整超参数。
- 通过逐步优化策略的成熟化过程,使智能体能够逐步超越其父策略的性能。
- 确保安全策略在新环境中的泛化能力,减少跨任务重复人类干预的需求。
提出的方法
- 在探索过程中实时使用人类指导进行干预,以防止危险行为,模拟父母的引导作用。
- 收集人类对智能体行为片段的偏好,以提供对动作序列的反馈,类比于事后的父母反馈。
- 应用监督学习,直接使用人类干预和偏好生成的标注数据训练智能体策略,避免指定奖励函数。
- 实施成熟化:一种渐进式训练方案,对越来越长的行为片段提供反馈,以实现长期策略优化。
- 使用类似值迭代的动力学机制,确保智能体策略随时间逐步改进,且值函数 $ V_T $ 随序列长度增加而收敛至最优。
- 通过避免奖励模型的分布偏移,保持与人类偏好的对称性,从而消除对奖励函数均值超参数调优的需求。
实验结果
研究问题
- RQ1结合人类干预与偏好反馈,是否能安全地训练强化学习智能体,而无需依赖预设的奖励函数?
- RQ2当奖励函数不完善或模糊时,如何缓解强化学习中的危险探索与奖励欺骗问题?
- RQ3学习智能体能否通过结构化、人类引导的成熟化过程,逐步超越其父策略?
- RQ4直接从人类反馈学习策略是否能避免基于偏好奖励建模中固有的分布偏移模糊性问题?
- RQ5通过 Parenting 学习的策略在多大程度上能泛化至新环境,而无需重新训练或重新干预?
主要发现
- Parenting 算法在 Leike 等人(2017)的 AI Safety Gridworlds 中成功缓解了全部五项核心人工智能安全问题——危险探索、奖励欺骗、负面副作用、不安全中断以及监督者缺失。
- 通过人类反馈直接监督学习训练的智能体策略对奖励函数偏移具有鲁棒性,且无需针对任务调整超参数。
- 通过成熟化过程,智能体性能随时间持续提升,最终超越其父策略,即使初始训练具有短视性。
- 成熟化过程中使用的值函数 $ V_T $ 以类似值迭代的方式收敛至最优值函数,确保长期最优性。
- 通过 Parenting 训练的策略具备良好的泛化能力,可推广至新环境,显著减少跨任务重复人类输入的需求。
- 该框架通过直接从人类反馈学习策略,避免了基于偏好奖励建模中的模糊性,同时保持了人类偏好的对称性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。