[论文解读] MetaVIM: Meta Variationally Intrinsic Motivated Reinforcement Learning for Decentralized Traffic Signal Control
MetaVIM 提出了一种用于去中心化交通信号控制的元强化学习框架,通过引入任务特定的潜在变量和内在奖励机制,在邻居策略不确定的环境下实现学习的稳定。通过将每个交叉口建模为一个元学习任务,并利用四个解码器强制实现观测/奖励不变性,MetaVIM 在 CityFlow 上实现了最先进性能,平均行程时间仅为 724.21(基线模型为 1096.82),在多种城市场景中展现出卓越的泛化能力和稳定性。
Traffic signal control aims to coordinate traffic signals across intersections to improve the traffic efficiency of a district or a city. Deep reinforcement learning (RL) has been applied to traffic signal control recently and demonstrated promising performance where each traffic signal is regarded as an agent. However, there are still several challenges that may limit its large-scale application in the real world. To make the policy learned from a training scenario generalizable to new unseen scenarios, a novel Meta Variationally Intrinsic Motivated (MetaVIM) RL method is proposed to learn the decentralized policy for each intersection that considers neighbor information in a latent way. Specifically, we formulate the policy learning as a meta-learning problem over a set of related tasks, where each task corresponds to traffic signal control at an intersection whose neighbors are regarded as the unobserved part of the state. Then, a learned latent variable is introduced to represent the task's specific information and is further brought into the policy for learning. In addition, to make the policy learning stable, a novel intrinsic reward is designed to encourage each agent's received rewards and observation transition to be predictable only conditioned on its own history. Extensive experiments conducted on CityFlow demonstrate that the proposed method substantially outperforms existing approaches and shows superior generalizability.
研究动机与目标
- 解决多交叉口交通控制中,由于邻居智能体行为引入不确定性,导致难以学习有效去中心化策略的挑战。
- 克服固定或启发式信号控制的局限性,实现可适应、数据驱动的学习,从而在多样化交通模式中实现泛化。
- 通过学习的潜在变量建模任务特定动态,提升在部分可观测、非平稳环境中的策略稳定性和收敛性。
- 通过在一系列相关交叉口控制任务上进行元学习,实现对新出现的、未见过的交通场景的快速适应。
- 设计一种内在奖励机制,鼓励观测和奖励对邻居策略的不变性,从而稳定训练过程并提升泛化能力。
提出的方法
- 将交通信号控制建模为元强化学习问题,其中每个交叉口作为一个任务,其历史轨迹和特定任务动态由唯一潜在变量编码。
- 引入一个基于过去轨迹的潜在变量,以表示任务特定的奖励、转移和策略结构,实现个性化策略适应。
- 部署四个解码器,用于在四种情境下预测下一时刻的观测和奖励:仅当前智能体、仅邻居智能体、两者皆有、两者皆无,所有预测均基于潜在变量。
- 设计一种内在奖励,通过最小化包含与不包含邻居策略时的预测差异,促进不变性并稳定学习过程。
- 利用内在奖励平衡探索与利用,鼓励智能体学习对邻居行为变化具有鲁棒性的策略。
- 通过元强化学习目标端到端训练策略,实现在极小微调下对新场景的快速适应。

实验结果
研究问题
- RQ1结合任务特定潜在变量的元强化学习能否在多样化、未见过的城市环境中提升去中心化交通信号控制的泛化能力?
- RQ2通过预测解码器建模邻居策略不确定性,能否提升多智能体交通控制中策略的稳定性和收敛性?
- RQ3基于观测和奖励不变性的内在奖励,在部分可观测、非平稳交通环境中,能在多大程度上提升学习效率和性能?
- RQ4通过元强化学习训练的去中心化策略能否在大规模真实交通网络中超越集中式或独立强化学习基线模型?
- RQ5所提出方法在不同城市和交通条件下交通模式分布偏移的情况下,如何应对?
主要发现
- MetaVIM 在四个真实城市(杭州、济南、纽约、深圳)中实现了 724.21 的平均行程时间,显著优于基线模型(1096.82),也优于 CoLight(767.75)和 MetaLight(1147.33)等现有方法。
- 在真实世界测试模式下,与基线相比,MetaVIM 将平均行程时间减少了 30.5%,其中杭州减少 44.8%,济南减少 34.7%,纽约减少 28.6%,深圳减少 30.4%。
- 该方法展现出卓越的泛化能力,在无需微调的情况下,对混合低流量、混合高流量及真实交通模式均表现强劲。
- 内在奖励机制显著降低了包含与不包含邻居策略情境下的预测误差差异,有助于实现稳定且鲁棒的策略学习。
- MetaVIM 在所有城市和交通条件下均优于最先进方法,如 CoLight、PressLight 和 SOTL,尤其在高变化性场景中表现更优。
- 消融实验表明,潜在变量与内在奖励组件均不可或缺:任一组件的移除均导致性能显著下降,验证了其在泛化与稳定性中的关键作用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。