[论文解读] MORAL: Aligning AI with Human Norms through Multi-Objective Reinforced Active Learning
MORAL 提出了一种多目标强化学习框架,结合对抗性逆向强化学习与主动偏好学习,从专家示范中对齐人工智能智能体与人类规范。通过使用在线策略经验学习标量化权重的分布,它在无需枚举多个奖励权重的情况下,高效识别出帕累托最优策略,在复杂且存在冲突的情境中捕捉规范性行为方面优于先前的方法。
Inferring reward functions from demonstrations and pairwise preferences are auspicious approaches for aligning Reinforcement Learning (RL) agents with human intentions. However, state-of-the art methods typically focus on learning a single reward model, thus rendering it difficult to trade off different reward functions from multiple experts. We propose Multi-Objective Reinforced Active Learning (MORAL), a novel method for combining diverse demonstrations of social norms into a Pareto-optimal policy. Through maintaining a distribution over scalarization weights, our approach is able to interactively tune a deep RL agent towards a variety of preferences, while eliminating the need for computing multiple policies. We empirically demonstrate the effectiveness of MORAL in two scenarios, which model a delivery and an emergency task that require an agent to act in the presence of normative conflicts. Overall, we consider our research a step towards multi-objective RL with learned rewards, bridging the gap between current reward learning and machine ethics literature.
研究动机与目标
- 解决从专家示范中对齐人工智能智能体与多个潜在冲突的人类规范的挑战。
- 通过在多目标框架中实现多样化专家偏好的权衡,克服单奖励学习的局限性。
- 开发一种交互式、样本高效的算法,避免计算多个策略的同时近似帕累托前沿。
- 通过人类在环的偏好查询,弥合奖励学习与机器伦理之间的差距,使智能体能够适应规范性冲突。
- 在需要遵守社会规范的任务场景(如配送和紧急任务)中,证明该方法的有效性。
提出的方法
- MORAL 首先使用对抗性逆向强化学习(AIRL)从专家示范中推断出向量值奖励函数。
- 随后进入交互式多目标强化学习循环,向专家查询关于在线策略轨迹的成对偏好。
- 该方法维护一个标量化权重的分布,表示奖励分量的线性组合,以指导策略优化。
- 通过使用在线策略经验进行偏好查询,MORAL 避免了对独立探索策略的需求,降低了样本复杂度。
- 该算法通过学习最优权重分布,直接近似帕累托最优策略,而无需详尽枚举。
- 它将深度强化学习与主动学习相结合,实现实时适应人类偏好,同时保持策略的一致性。
实验结果
研究问题
- RQ1多目标强化学习框架能否有效从专家示范中学习并权衡多个规范?
- RQ2如何将主动偏好学习与逆向强化学习结合,以提高多目标策略学习中的样本效率?
- RQ3该方法能否在不显式计算不同奖励权重下多个策略的情况下,近似帕累托最优策略?
- RQ4该方法在存在规范性冲突的环境(如配送和紧急场景)中泛化能力如何?
- RQ5该方法在多大程度上能自动从一致的专家行为中推断出隐含的社会规范?
主要发现
- MORAL 在涉及规范性冲突的两个网格世界环境中成功检索出帕累托最优策略,该任务中优于 DRLHP。
- 通过使用在线策略经验进行主动偏好查询,该方法实现了高样本效率,减少了所需的专家交互次数。
- 当专家示范具有一致性时,该方法能有效捕捉隐含的社会规范,显示出查询选择的丰富信息性。
- 标量化权重的分布使得无需重新训练或枚举策略即可实现细粒度策略调优。
- 该方法缓解了多目标强化学习中常见的奖励尺度差异问题,提升了稳定性和收敛性。
- 实验表明,MORAL 可通过交互式学习适应多样化的人类偏好,同时保持与社会规范的一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。