Skip to main content
QUICK REVIEW

[论文解读] Multi-agent deep reinforcement learning with centralized training and decentralized execution for transportation infrastructure management

Mohammad Saifullah, Konstantinos G. Papakonstantinou|arXiv (Cornell University)|Jan 23, 2024
Infrastructure Maintenance and Monitoring被引用 4
一句话总结

本文提出了一种基于集中训练、分散执行(CTDE)的深度去中心化多智能体演员-critic框架(DDMAC-CTDE),用于在不确定性和约束条件下优化大规模交通网络的检测与维护。该方法将问题建模为受限的部分可观察马尔可夫决策过程(POMDP),实现了对弗吉尼亚州96个基础设施组件的近似最优、可扩展的决策,相比传统策略在成本效率上提升了7.5%–31%。

ABSTRACT

Life-cycle management of large-scale transportation systems requires determining a sequence of inspection and maintenance decisions to minimize long-term risks and costs while dealing with multiple uncertainties and constraints that lie in high-dimensional spaces. Traditional approaches have been widely applied but often suffer from limitations related to optimality, scalability, and the ability to properly handle uncertainty. Moreover, many existing methods rely on unconstrained formulations that overlook critical operational constraints. We address these issues in this work by casting the optimization problem within the framework of constrained Partially Observable Markov Decision Processes (POMDPs), which provide a robust mathematical foundation for stochastic sequential decision-making under observation uncertainties, in the presence of risk and resource limitations. To tackle the high dimensionality of state and action spaces, we propose DDMAC-CTDE, a Deep Decentralized Multi-Agent Actor-Critic (DDMAC) reinforcement learning architecture with Centralized Training and Decentralized Execution (CTDE). To demonstrate the utility of the proposed framework, we also develop a new comprehensive benchmark environment representing an existing transportation network in Virginia, U.S., with heterogeneous pavement and bridge assets undergoing nonstationary degradation. This environment incorporates multiple practical constraints related to budget limits, performance guidelines, traffic delays, and risk considerations. On this benchmark, DDMAC-CTDE consistently outperforms standard transportation management baselines, producing better policies. Together, the proposed framework and benchmark provide (i) a scalable, constraint-aware methodology, and (ii) a realistic, rigorous testbed for comprehensive evaluation of Deep Reinforcement Learning (DRL) for transportation infrastructure management.

研究动机与目标

  • 解决静态、基于状态或基于风险的维护策略在管理具有高维状态和动作空间的大型异构交通网络时的局限性。
  • 通过将基础设施管理建模为具有部分观测和动态退化特性的受限POMDP,克服传统优化方法在可扩展性和最优性方面的挑战。
  • 开发一种可扩展的去中心化强化学习框架,实现在多个基础设施智能体(如桥梁、路面)之间实时、约束感知的决策。
  • 通过在深度强化学习公式中引入硬约束和软约束,将现实世界约束(如预算限制、安全目标和交通延误成本)整合到学习过程中。
  • 在弗吉尼亚州一个包含96个组件的真实网络上展示该框架的有效性,涵盖完整和退化两种初始状态。

提出的方法

  • 将基础设施管理问题建模为受限的部分可观察马尔可夫决策过程(POMDP),以捕捉随机退化、不完全观测和资源约束。
  • 开发一种新型的深度去中心化多智能体演员-critic(DDMAC)算法,采用集中训练与分散执行(CTDE)机制,实现基于全局价值函数的联合训练和基于局部状态信息的独立执行。
  • 使用关键状态指数(CCI)和国际粗糙度指数(IRI)来建模路面状态的演变,使用桥面性能指标表示桥梁的退化动态。
  • 在深度强化学习损失函数中整合硬约束(如预算限制)和软约束(如安全目标),以确保符合FHWA和VDOT标准。
  • 通过稀疏参数化与经验回放相结合的方式训练DDMAC-CTDE智能体,以在高维、非平稳环境中稳定学习。
  • 将网络分解为每个基础设施组件(桥梁或路面类型)作为独立智能体,每个智能体基于局部观测进行行动,同时在集中式价值函数下进行联合训练。

实验结果

研究问题

  • RQ1具有集中训练与分散执行机制的多智能体深度强化学习框架,能否在部分可观测性和复杂约束条件下有效管理大规模异构交通网络?
  • RQ2与传统的基于状态维护(CBM)和机构推荐策略相比,所提出的DDMAC-CTDE方法在长期成本和风险表现方面表现如何?
  • RQ3该框架在保持可扩展性和最优性的同时,能在多大程度上处理现实约束,如预算限制、安全目标和交通延误成本?
  • RQ4在不确定性条件下,所学习的策略如何在不同基础设施类型(如I类桥梁与次要路面)之间优先安排检测与维护行动?
  • RQ5初始网络状态(完整状态与退化状态)对DDMAC-CTDE策略的性能和成本效率有何影响?

主要发现

  • 当从完整状态初始时,DDMAC-CTDE框架相比启发式优化的基于状态维护(CBM)策略,将全生命周期总成本降低了7.5%。
  • 在相同完整初始状态下,DDMAC-CTDE策略比弗吉尼亚州交通部(VDOT)推荐的基线策略成本低31%。
  • 当从2021年 Hampton Roads 网络的实际状态(非完整状态)初始化时,DDMAC-CTDE策略仍优于基线策略,分别比CBM和VDOT策略更具成本效益7.3%和27%。
  • 该框架成功遵守了FHWA和VDOT设定的所有性能与约束目标,包括安全、预算和风险阈值,即使在部分可观测条件下也成立。
  • 策略模拟显示,由于更高的失效风险和维护成本,I类桥梁和主要路面被系统性优先处理,维护行动显著降低了系统风险,并在风险曲线上引发明显的下降跳跃。
  • 成本分布严重偏向桥梁(在完整初始情况下占比高达79%),反映出其更高的维护与风险成本;主要路面因数量庞大(47个组件)而承担最大成本份额。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。