[论文解读] Parameter Sharing Reinforcement Learning Architecture for Multi Agent Driving Behaviors
本文提出了一种参数共享的深度确定性策略梯度(PS-DDPG)架构,用于多智能体驾驶行为学习,通过共享的演员-critic网络实现车道保持与超车行为的同步且可扩展的训练。该方法在无需显式通信的情况下实现了更快的收敛速度和稳定的协作行为,相较于独立的DDPG训练,在样本效率和可扩展性方面表现更优。
Multi-agent learning provides a potential framework for learning and simulating traffic behaviors. This paper proposes a novel architecture to learn multiple driving behaviors in a traffic scenario. The proposed architecture can learn multiple behaviors independently as well as simultaneously. We take advantage of the homogeneity of agents and learn in a parameter sharing paradigm. To further speed up the training process asynchronous updates are employed into the architecture. While learning different behaviors simultaneously, the given framework was also able to learn cooperation between the agents, without any explicit communication. We applied this framework to learn two important behaviors in driving: 1) Lane-Keeping and 2) Over-Taking. Results indicate faster convergence and learning of a more generic behavior, that is scalable to any number of agents. When compared the results with existing approaches, our results indicate equal and even better performance in some cases.
研究动机与目标
- 开发一种可扩展的、参数共享的强化学习框架,用于模拟真实的多智能体交通行为。
- 通过单一共享策略网络实现在车道保持与超车行为上的同步学习。
- 通过利用智能体同质性与异步更新,提升训练效率与收敛速度。
- 证明在共享学习范式下,协作行为可自然涌现,无需显式通信。
- 为自动驾驶模拟器中生成基于行为的交通流提供可扩展的解决方案。
提出的方法
- 所有同质智能体共享一个演员-critic网络架构,减少参数数量并支持经验共享。
- 每个智能体向经验回放缓冲区贡献经验,共享网络使用每时间步N步更新进行异步更新。
- 状态空间包含相对位置、速度与车道信息;动作为连续控制输入(转向与油门)。
- 采用复合奖励函数,结合进度、安全性和行为特定组件,以同时鼓励车道保持与超车行为。
- 通过课程学习与异步训练,在非平稳多智能体环境中稳定学习。
- 框架支持动态添加智能体而无需重新训练,可扩展至任意数量的智能体。
实验结果
研究问题
- RQ1单一共享的演员-critic网络能否同时学习多种不同的驾驶行为——车道保持与超车?
- RQ2与独立的DDPG训练相比,同质智能体之间的参数共享是否能提升训练速度与收敛性能?
- RQ3在共享策略框架下,智能体间的协作是否可在无显式通信的情况下自然涌现?
- RQ4该框架在环境中智能体数量增加时的可扩展性如何?
- RQ5共享经验回放与异步更新对学习稳定性与性能有何影响?
主要发现
- PS-DDPG在600个训练周期内实现超车与车道保持的收敛,而独立DDPG训练则超过2,000个周期。
- 共享网络能够同时稳定学习两种行为,且在不同智能体配置(A、B与C类情形)下表现稳健,显示出对场景布局的鲁棒性。
- 在同步学习中,平均进度分别达到59.36(A类)、82.18(B类)与60.17(C类),表明在各类场景中行为学习的一致性。
- 由于场景复杂性,碰撞率高于单一行为学习,但保持稳定,20个周期内分别为79.33(A类)、142(B类)与111(C类)。
- 框架使智能体能够自然协作:车道保持智能体会减速以允许超车智能体通过,之后再加速以最大化进度。
- 该方法展现出良好的可扩展性,新增智能体无需重新训练或显著增加资源,适用于大规模交通模拟器部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。