[论文解读] Emergent Social Learning via Multi-agent Reinforcement Learning
该论文表明,多智能体强化学习(MARL)智能体能够学会使用社会学习——通过观察和跟随专家——来发现复杂行为,并泛化到新环境。通过引入基于模型的辅助损失并混合社会学习与独立训练,智能体学会在适当时机利用专家提示,在零样本迁移和独立性能方面均优于仅独立训练或模仿学习的智能体。
Social learning is a key component of human and animal intelligence. By taking cues from the behavior of experts in their environment, social learners can acquire sophisticated behavior and rapidly adapt to new circumstances. This paper investigates whether independent reinforcement learning (RL) agents in a multi-agent environment can learn to use social learning to improve their performance. We find that in most circumstances, vanilla model-free RL agents do not use social learning. We analyze the reasons for this deficiency, and show that by imposing constraints on the training environment and introducing a model-based auxiliary loss we are able to obtain generalized social learning policies which enable agents to: i) discover complex skills that are not learned from single-agent training, and ii) adapt online to novel environments by taking cues from experts present in the new environment. In contrast, agents trained with model-free RL or imitation learning generalize poorly and do not succeed in the transfer tasks. By mixing multi-agent and solo training, we can obtain agents that use social learning to gain skills that they can deploy when alone, even out-performing agents trained alone from the start.
研究动机与目标
- 探究独立深度强化学习智能体是否能在无显式教学或模仿的情况下学习社会学习。
- 识别在无共享奖励或教学激励的多智能体环境中社会学习出现的条件。
- 通过实时学习专家提示,提升泛化能力并减少昂贵的个体探索。
- 开发一种训练方案,使智能体能够保留社会学习技能以用于独立环境。
- 证明通过强化学习实现的社会学习在迁移能力和性能上优于模仿学习和独立训练。
提出的方法
- 设计一个高个体探索成本和声望线索的多智能体环境,以激励社会学习。
- 使用无模型的PPO智能体,并引入基于模型的辅助损失,以隐式预测和建模其他智能体的策略。
- 交错进行带专家和不带专家的训练回合,以防止对专家提示的过度依赖。
- 训练智能体在有益时选择性地跟随专家,同时保持强大的个体性能。
- 使用预测头估计专家行为,使智能体能够在无显式奖励塑造的情况下从他人学习。
- 通过在包含新专家的新环境中进行零样本迁移评估泛化能力。
实验结果
研究问题
- RQ1独立深度强化学习智能体能否通过社会学习发现个体探索无法找到的复杂行为?
- RQ2智能体能否在无先前接触的情况下,通过观察新专家在线适应新环境?
- RQ3与模仿学习或独立训练相比,社会学习是否能提升泛化能力?
- RQ4能否通过社会学习训练的智能体在性能上超越仅在独立环境中训练的智能体?
- RQ5社会学习在MARL中出现所需的环境和训练条件是什么?
主要发现
- 使用基于模型的辅助损失训练的智能体成功学会了社会学习,而原始无模型强化学习智能体则未能实现。
- 社会学习使智能体能够发现复杂技能——例如在高探索成本环境中的最优导航——这些技能无法通过独立训练获得。
- 在混合社会与独立训练回合中训练的智能体,即使在无专家的环境中,也优于仅在独立环境中训练的智能体。
- 在零样本迁移至包含新专家的新环境中时,社会学习智能体显著优于仅独立训练的智能体和模仿学习智能体。
- 模仿学习的表现与专家水平相当,但无法适应新专家;而社会学习智能体则能主动寻找并利用新专家的提示。
- 训练期间对专家的过度依赖会导致独立性能下降;通过交错进行独立与社会训练,可缓解此问题并实现稳健的泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。