Skip to main content
QUICK REVIEW

[论文解读] Transfer Learning versus Multi-agent Learning regarding Distributed Decision-Making in Highway Traffic

Mark Schutera, Niklas Goby|arXiv (Cornell University)|Oct 19, 2018
Reinforcement Learning in Robotics参考文献 7被引用 5
一句话总结

本文使用MIT DeepTraffic模拟器,比较了在高速公路交通分布式决策中迁移学习与多智能体强化学习的性能。通过深度Q网络(DQN)在进化超参数搜索框架下训练智能体,随后对比单智能体迁移学习与联合多智能体训练的性能。主要发现是,在复杂混合智能交通中,尤其在智能体密度较高时,多智能体学习优于迁移学习,因其能更好地适应多智能体交互,且显著减少严重拥堵事件。

ABSTRACT

Transportation and traffic are currently undergoing a rapid increase in terms of both scale and complexity. At the same time, an increasing share of traffic participants are being transformed into agents driven or supported by artificial intelligence resulting in mixed-intelligence traffic. This work explores the implications of distributed decision-making in mixed-intelligence traffic. The investigations are carried out on the basis of an online-simulated highway scenario, namely the MIT \emph{DeepTraffic} simulation. In the first step traffic agents are trained by means of a deep reinforcement learning approach, being deployed inside an elitist evolutionary algorithm for hyperparameter search. The resulting architectures and training parameters are then utilized in order to either train a single autonomous traffic agent and transfer the learned weights onto a multi-agent scenario or else to conduct multi-agent learning directly. Both learning strategies are evaluated on different ratios of mixed-intelligence traffic. The strategies are assessed according to the average speed of all agents driven by artificial intelligence. Traffic patterns that provoke a reduction in traffic flow are analyzed with respect to the different strategies.

研究动机与目标

  • 评估迁移学习与多智能体强化学习在混合智能高速公路交通分布式决策中的性能表现。
  • 研究不同学习策略对模拟高速公路环境中平均速度与交通流模式的影响。
  • 评估智能体数量增加对拥堵与流效率的影响。
  • 确定迁移学习是否能有效从单智能体训练泛化到多智能体场景的交通控制。

提出的方法

  • 在MIT DeepTraffic模拟器中,基于深度强化学习框架,使用深度Q网络(DQN)训练交通智能体。
  • 采用精英进化算法优化智能体训练的超参数(如学习率、网络深度、经验回放大小)。
  • 通过使用单智能体模型的预训练权重,初始化多个智能体,实现迁移学习。
  • 通过在相同环境中联合训练多个智能体并共享学习目标,实现直接的多智能体训练。
  • 在不同智能体与人工驾驶车辆比例下评估两种策略,测量平均速度与拥堵模式。
  • 使用基于Python的Selenium机器人,自动化多个模拟运行的训练、验证与评估流程。

实验结果

研究问题

  • RQ1在混合智能高速公路交通中,迁移学习与多智能体学习在平均速度与交通流方面有何差异?
  • RQ2从单个训练智能体迁移学习是否能有效泛化到多智能体场景,还是会导致次优的交互动态?
  • RQ3迁移学习与多智能体学习策略在拥堵模式(尤其是严重阻塞与低速减速)方面有何不同?
  • RQ4在每种学习策略下,智能体数量与拥堵事件频率之间存在何种关系?
  • RQ5随着智能体密度增加,多智能体学习是否相较于迁移学习展现出性能优势?

主要发现

  • 多智能体学习在平均速度与交通流方面优于迁移学习,尤其在智能体数量增加时表现更优。
  • 随着训练智能体数量增加,拥堵事件数量上升,但最严重的阻塞事件(图6中深灰色线)稳定在约50起,表明最坏情况性能保持一致。
  • 两种策略下的拥堵事件中,相当大一部分涉及低速减速(1–11英里/小时),表明智能体能从轻微扰动中快速恢复。
  • 迁移学习策略的平均性能与多智能体学习相当,但缺乏通过联合训练发展出的自适应交互能力。
  • 交通流模式分析表明,减速幅度与恢复时间对流质量的影响,比拥堵事件的绝对数量更为关键。
  • 结果表明,随着高速公路上智能体占比的提升,多智能体学习的重要性将日益凸显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。