[论文解读] ModelLight: Model-Based Meta-Reinforcement Learning for Traffic Signal Control
ModelLight 提出了一种基于模型的元强化学习框架,用于交通信号控制,通过使用神经网络动力学模型的集成来生成合成转移,从而提高数据效率,实现在极少真实环境交互下快速学习策略。该方法仅用10轮训练即达到最先进性能,优于需100轮训练的MetaLight。
Traffic signal control is of critical importance for the effective use of transportation infrastructures. The rapid increase of vehicle traffic and changes in traffic patterns make traffic signal control more and more challenging. Reinforcement Learning (RL)-based algorithms have demonstrated their potential in dealing with traffic signal control. However, most existing solutions require a large amount of training data, which is unacceptable for many real-world scenarios. This paper proposes a novel model-based meta-reinforcement learning framework (ModelLight) for traffic signal control. Within ModelLight, an ensemble of models for road intersections and the optimization-based meta-learning method are used to improve the data efficiency of an RL-based traffic light control method. Experiments on real-world datasets demonstrate that ModelLight can outperform state-of-the-art traffic light control algorithms while substantially reducing the number of required interactions with the real-world environment.
研究动机与目标
- 为解决模型无关强化学习在真实世界交通信号控制中样本复杂度过高的问题,因为大量真实环境交互在实际中不可行。
- 通过结合基于模型的强化学习与元学习,提升交通信号控制的数据效率,实现对新路口的快速适应。
- 通过利用学习到的动力学模型生成的合成经验,减少对真实环境交互的依赖,缓解大规模真实世界训练的需求。
- 通过使用神经网络模型的集成而非单一全局模型,提升对动力学建模偏差的鲁棒性。
- 通过元学习初始化实现对多样化路口类型的快速策略适应,即使训练数据有限。
提出的方法
- 训练一组基于神经网络的动力学模型,以模拟交通状态转移,生成合成(虚构)轨迹用于策略训练。
- 使用随机起始的短轨迹生成多样化、低误差的合成轨迹,减少模型误差的累积。
- 通过MAML进行元学习,学习一种最优策略初始化,使其可在新路口上仅通过极少真实交互快速微调。
- 在策略训练期间使用FRAP++网络近似Q函数,提升样本效率与稳定性。
- 将基于模型的轨迹回放与元强化学习相结合,减少对真实环境交互的依赖,同时保持高性能。
- 开展超参数消融实验,以优化轨迹回放长度、模型架构(如LSTM与全连接网络对比)及集成规模。
实验结果
研究问题
- RQ1基于模型的元强化学习框架是否能显著减少有效交通信号控制所需的真实环境交互次数?
- RQ2使用动力学模型的集成与单一全局模型相比,能否更有效地减少模型偏差并提升策略泛化能力?
- RQ3短轨迹与随机起始在多大程度上提升了合成经验的质量,并减少基于模型轨迹回放中的误差累积?
- RQ4与标准强化学习基线相比,元强化学习初始化是否能实现更快收敛与更优性能,且训练轮次更少?
- RQ5ModelLight在多样化路口类型与真实交通场景下,仅通过极少真实交互,性能表现如何?
主要发现
- ModelLight 仅通过10轮真实交互训练,性能即与经过100轮训练的MetaLight相当或更优,表明真实交互需求减少了90%。
- 在任务1中,ModelLight 将平均行程时间减少3.95%至5.22%,在任务2中改善最高达15.54%。
- 与单一全局模型相比,使用模型集成在所有任务上平均提升性能14.54%,证实其在减少模型偏差方面的有效性。
- 基于LSTM的动力学模型在性能与参数效率方面均优于高斯过程与全连接网络,取得最佳行程时间表现。
- 短轨迹(L=36,默认值)与L=120性能相近,而L=360(无短轨迹)表现最差,证实短轨迹在误差缓解方面的优势。
- 消融实验表明,随机起始与短轨迹显著提升泛化能力,并减少合成经验生成中的误差累积。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。