Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning for Dynamic Urban Transportation Problems

Laura Luise Schultz, Vadim Sokolov|arXiv (Cornell University)|Jun 14, 2018
Traffic control and management参考文献 37被引用 10
一句话总结

本文提出了一种深度强化学习(DRL)框架,利用深度学习元模型优化动态城市交通系统,通过近似复杂模拟器的动力学特性降低计算成本。在交通分配问题中,基于DQN的需求重新路由实现了51%的系统行程时间改善,该方法在真实世界模拟数据上得到验证。

ABSTRACT

We explore the use of deep learning and deep reinforcement learning for optimization problems in transportation. Many transportation system analysis tasks are formulated as an optimization problem - such as optimal control problems in intelligent transportation systems and long term urban planning. Often transportation models used to represent dynamics of a transportation system involve large data sets with complex input-output interactions and are difficult to use in the context of optimization. Use of deep learning metamodels can produce a lower dimensional representation of those relations and allow to implement optimization and reinforcement learning algorithms in an efficient manner. In particular, we develop deep learning models for calibrating transportation simulators and for reinforcement learning to solve the problem of optimal scheduling of travelers on the network.

研究动机与目标

  • 解决大规模城市交通系统中基于仿真的优化所面临的高计算成本问题。
  • 开发一种基于深度学习的元模型,以捕捉交通模拟器高维输入-输出关系中的低维模式。
  • 应用带有神经网络函数逼近器的深度强化学习,解决动态交通控制与调度问题。
  • 与贝叶斯或滤波方法相比,提升模拟器校准中的样本效率。
  • 证明DRL在优化动态交通分配与全系统行程时间方面的有效性。

提出的方法

  • 训练一个深度神经网络以近似复杂、随机的交通模拟器的输入-输出映射,从而实现高效优化。
  • 该架构采用组合神经网络进行降维,替代传统的主动子空间方法。
  • 使用深度Q网络(DQN)学习跨时间段的最优需求重新路由策略,状态由当前和待处理的需求定义。
  • 动作空间允许在时间段之间移动0–2个单位的需求,或重新路由至替代目的地。
  • 奖励函数为负的总系统行程时间,通过模拟器中的迭代Frank-Wolfe均衡求解器计算。
  • DQN在100个24小时需求序列的训练周期中进行训练,性能在未见过的需求模式上进行评估。

实验结果

研究问题

  • RQ1深度学习元模型能否有效降低复杂交通模拟器中输入-输出关系的维度?
  • RQ2在模拟器校准中,基于深度学习的元模型与贝叶斯或滤波技术相比,样本效率如何?
  • RQ3带有函数逼近的深度强化学习是否比传统方法更有效地解决动态交通分配问题?
  • RQ4基于DQN的需求重新路由对模拟城市网络中全系统行程时间有何影响?
  • RQ5DQN策略在24小时调度周期内对未见过的需求模式的泛化能力如何?

主要发现

  • 与贝叶斯和滤波技术相比,深度学习元模型在校准交通模拟器方面表现出更优的样本效率。
  • 基于DQN的策略相比原始需求分布,将总系统行程时间减少了51%。
  • 最优策略在高峰时段(特别是14–24小时)持续将1–2个单位的需求从主干道(1→2)重新路由至替代路径(1→3)。
  • DQN策略展现出强大的泛化能力,能有效处理训练期间未见过的随机生成需求模式。
  • 采用组合神经网络进行降维,使输入参数空间的探索更加高效。
  • 实证结果表明,最坏情况下的理论收敛边界并不能反映实际中DRL在交通应用中观察到的快速收敛现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。