[论文解读] Multi-Principal Assistance Games: Definition and Collegial Mechanisms
本文提出了多主顾协助博弈(MPAGs),其中单个AI代理协助具有分歧偏好的多个个体。它提出了一种“共事机制”,利用人类在示范中付出的真实世界努力作为激励,促使诚实的偏好披露,实现主导策略的激励相容性,并绕过了社会选择理论中的吉尔伯德不可能定理。
We introduce the concept of a multi-principal assistance game (MPAG), and circumvent an obstacle in social choice theory, Gibbard's theorem, by using a sufficiently collegial preference inference mechanism. In an MPAG, a single agent assists N human principals who may have widely different preferences. MPAGs generalize assistance games, also known as cooperative inverse reinforcement learning games. We analyze in particular a generalization of apprenticeship learning in which the humans first perform some work to obtain utility and demonstrate their preferences, and then the robot acts to further maximize the sum of human payoffs. We show in this setting that if the game is sufficiently collegial, i.e. if the humans are responsible for obtaining a sufficient fraction of the rewards through their own actions, then their preferences are straightforwardly revealed through their work. This revelation mechanism is non-dictatorial, does not limit the possible outcomes to two alternatives, and is dominant-strategy incentive-compatible.
研究动机与目标
- 解决AI系统与具有冲突偏好的多个主顾对齐的挑战。
- 克服传统价值对齐方法的局限性,后者假设单一主顾,且易受策略性虚假陈述的影响。
- 设计一种机制,确保真实偏好报告,而无需独裁控制或受限的结果空间。
- 将模仿学习推广至多人情境,其中人类的努力独立影响效用,从而实现偏好推断。
- 基于共事作为设计原则,为多主顾AI系统中的激励相容偏好聚合建立理论基础。
提出的方法
- 将多主顾协助博弈(MPAG)定义为合作逆强化学习的推广,包含N个主顾。
- 引入一种“共事机制”,利用人类示范会带来真实世界成本(如努力、时间)的特性,且该成本独立于AI行为。
- 将偏好推断问题建模为有限时域MDP的正则化对偶问题,采用特征匹配逆行为模仿(LfD),并加入偏好不一致的惩罚项。
- 将优化目标表述为在确保偏好一致性的同时最大化社会福利:$\beta\sum_{s,a,t}\gamma^{t}\rho^{t}_{s,a}\phi(s)^{T}w - \left\|\sum_{s,a,t}\rho^{t}_{s,a}\phi(s) - (N\mathbb{E}[\phi|w] - \sum_{j\neq i}\phi(\tau_{j}))\right\|^{2}$。
- 提出一种协作机制,其中机器人选择合作的人类,有条件地分配奖励,并使用停止规则来平衡探索与利用。
- 利用序数投票理论的工具,对机制的扭曲程度进行界控,在简化的序列模型中实现$\triangle(\mathcal{M}) = O(\sqrt{M\log M})$。
实验结果
研究问题
- RQ1能否设计一种机制,使得多个具有策略性的个体在AI协助情境中被激励如实披露其偏好?
- RQ2如何利用人类示范中真实世界成本(如努力)的存在,以确保偏好推断中的激励相容性?
- RQ3在多主顾系统中,共事性(定义为人类独立承担自身行为成本)在多大程度上可绕过吉尔伯德定理等经典不可能结果?
- RQ4结合偏好推断与人机联合行动的协作机制,在多主顾情境下的渐近性能如何?
- RQ5一种机制能否在不依赖独裁控制或二元结果约束的前提下,同时实现效率(最大化社会福利)与激励相容性?
主要发现
- 当示范努力权重$\beta$超过100时,策略性示范者被激励诚实,导致网格世界实验中社会福利显著提升。
- 共事机制实现了主导策略激励相容性,即无论他人行为如何,诚实报告始终是最优策略。
- 该机制通过不限制结果为两种选择或依赖独裁控制,避免了传统社会选择机制的约束。
- 在协作情境中,所提机制实现了渐近扭曲界$O(\sqrt{M\log M})$,其中$M$为动作数量。
- 模型表明,当人类为其示范付出真实成本(如时间、努力)时,其行为即使在策略性激励下,也能成为偏好的可靠信号。
- 结果表明,将真实世界后果嵌入偏好信号中的共事性,可作为多主顾系统中激励相容AI对齐的稳健基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。