[论文解读] Social diversity and social preferences in mixed-motive reinforcement learning
本文将社会价值取向(SVO)引入多智能体强化学习,以建模混合动机博弈中的多样化社会偏好。通过赋予智能体不同的SVO(从自私到亲社会不等),研究发现,在集体表现和策略泛化方面,异质性群体优于同质性群体,尤其是在对等敏感指标下表现更优。
Recent research on reinforcement learning in pure-conflict and pure-common interest games has emphasized the importance of population heterogeneity. In contrast, studies of reinforcement learning in mixed-motive games have primarily leveraged homogeneous approaches. Given the defining characteristic of mixed-motive games--the imperfect correlation of incentives between group members--we study the effect of population heterogeneity on mixed-motive reinforcement learning. We draw on interdependence theory from social psychology and imbue reinforcement learning agents with Social Value Orientation (SVO), a flexible formalization of preferences over group outcome distributions. We subsequently explore the effects of diversity in SVO on populations of reinforcement learning agents in two mixed-motive Markov games. We demonstrate that heterogeneity in SVO generates meaningful and complex behavioral variation among agents similar to that suggested by interdependence theory. Empirical results in these mixed-motive dilemmas suggest agents trained in heterogeneous populations develop particularly generalized, high-performing policies relative to those trained in homogeneous populations.
研究动机与目标
- 研究社会偏好多样性对混合动机环境中多智能体强化学习的影响。
- 解决在混合动机马尔可夫博弈中对对手异质性关注不足的问题,这与纯冲突或纯共同利益设置中的情况不同。
- 使用社会价值取向(SVO)建模人类般的社会偏好,SVO是对奖励分配内在动机的形式化表达。
- 评估SVO多样性是否能带来比同质性群体更鲁棒、更高性能且更具泛化能力的智能体策略。
- 通过将智能体动机建立在相互依赖理论和SVO框架之上,弥合多智能体强化学习与社会心理学之间的鸿沟。
提出的方法
- 为强化学习智能体赋予社会价值取向(SVO),即对自身与他人结果偏好的一种参数化表示。
- 将SVO应用于两个混合动机马尔可夫博弈:HarvestPatch和一个修改版的囚徒困境变体。
- 使用多智能体强化学习算法训练智能体,其中SVO作为内在动机组成部分。
- 通过改变群体中SVO的分布,创建同质性(例如,全部为利他主义)和异质性(例如,混合自私、亲社会、竞争性)的训练制度。
- 应用相互依赖理论中的结果转换过程,将原始收益映射为反映主观偏好的有效收益矩阵。
- 使用集体奖励和对等敏感指标(如收益分配的基尼系数)评估性能。
实验结果
研究问题
- RQ1在混合动机马尔可夫博弈中,社会偏好(SVO)的群体异质性如何影响学习结果?
- RQ2基于SVO的内在动机多样性是否能带来比同质SVO群体更高的集体表现?
- RQ3在异质SVO群体中训练的智能体是否相比同质环境中的智能体,发展出更具泛化性和鲁棒性的策略?
- RQ4SVO驱动的偏好在多智能体互动中在多大程度上与相互依赖理论的预测一致?
- RQ5SVO多样性是否能缓解双方同时采用亲社会转换时产生的低效问题?
主要发现
- 异质SVO群体在集体回报方面显著优于同质利他主义群体,尤其在对等敏感指标下表现更优。
- 在异质群体中训练的智能体发展出更具泛化性的策略,表现出对多样化对手行为的鲁棒性。
- 在HarvestPatch环境中,SVO值较高的智能体更可能在苹果尚未收获的情况下清理河流,表明其具备亲社会协调能力。
- 同质利他主义群体产生了过度特化的智能体,它们分别利用内在或外在动机,导致群体整体表现次优。
- 结果与相互依赖理论的预测一致:当双方均采用亲社会转换时,可能导致次优结果。
- SVO多样性使群体能够避免对称亲社会性带来的低效问题,支持稳定、高性能惯例的出现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。