[论文解读] Dynamic value alignment through preference aggregation of multiple objectives
本文提出了一种基于多目标偏好聚合的动态价值对齐方法,用于强化学习智能体,使其能够实时适应人类偏好的变化。通过为每个目标分别训练深度Q网络(DQN),并使用比例投票机制聚合偏好,该方法避免了奖励欺骗(reward hacking),在速度、停车次数和等待时间之间实现了平衡性能,优于仅优化单一目标的方法,后者往往以牺牲公平性为代价来优先考虑某一指标。
The development of ethical AI systems is currently geared toward setting objective functions that align with human objectives. However, finding such functions remains a research challenge, while in RL, setting rewards by hand is a fairly standard approach. We present a methodology for dynamic value alignment, where the values that are to be aligned with are dynamically changing, using a multiple-objective approach. We apply this approach to extend Deep $Q$-Learning to accommodate multiple objectives and evaluate this method on a simplified two-leg intersection controlled by a switching agent.Our approach dynamically accommodates the preferences of drivers on the system and achieves better overall performance across three metrics (speeds, stops, and waits) while integrating objectives that have competing or conflicting actions.
研究动机与目标
- 解决强化学习中静态奖励函数带来的挑战,因为固定优化目标可能导致策略错位和不公平。
- 使AI智能体能够动态适应现实世界控制系统(如交通信号交叉口)中人类偏好的实时变化。
- 通过参与式投票聚合多个相互冲突的目标(如速度、停车次数、等待时间),提升公平性和整体系统性能。
- 证明通过投票实现的多目标聚合优于单一目标的奖励塑造方法,尤其在避免次优或不公解决方案方面表现更优。
- 探索可扩展的、去中心化的价值对齐方法,避免固定奖励工程和算法专制的陷阱。
提出的方法
- 该方法通过为每个目标(如最小化停车次数、最小化等待时间)分别训练独立的深度Q网络(DQN),扩展了深度Q学习。
- 在每个决策步骤中,系统通过比例投票机制收集模拟驾驶员(代表不同用户群体)的偏好,以确定哪个目标应优先执行。
- 最终动作基于所有目标的Q值加权聚合选择,其中权重由各目标获得的票数比例决定。
- 投票机制采用比例代表制,以减少简单多数投票中常见的‘多数人暴政’和‘无效选票’等问题。
- 该方法无需预先设定固定的奖励权重,从而避免因权重设置错误而导致的策略错位。
- 该方法在模拟的两车道交叉口环境中进行了评估,智能体根据动态用户偏好控制交通信号灯。

实验结果
研究问题
- RQ1强化学习智能体能否在多目标控制系统中动态对齐不断变化的人类偏好?
- RQ2与多数票制相比,通过比例投票进行偏好聚合在公平性和系统性能方面表现如何?
- RQ3多目标聚合能否防止因单一目标奖励塑造而产生的奖励欺骗和次优策略?
- RQ4基于实时用户输入动态调整目标权重,对速度、停车次数和等待时间等关键性能指标有何影响?
- RQ5该方法在不需重新训练或手动调整权重的情况下,能否有效扩展到多个目标?
主要发现
- 所提方法成功避免了单目标训练中常见的‘奖励欺骗’问题,即为最小化停车次数而造成某一方向的等待时间过长。
- 通过比例投票聚合偏好,系统在速度、停车次数和等待时间三项指标上实现了均衡表现,未偏向任一单一目标。
- 该方法优于采用固定权重线性组合目标的基线方法,后者导致次优均衡状态,表现为停车次数接近零但等待时间极高。
- 比例投票在缓解‘多数人暴政’等公平性问题以及保障少数群体偏好代表性方面,优于多数票制。
- 该方法在用户偏好分布变化时表现出鲁棒性,即使在用户偏好为50-50的极端情况下,也能保持稳定的性能表现。
- 该方法为传统多目标强化学习提供了可扩展的替代方案,新增目标或调整权重时无需重新训练。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。