Skip to main content
QUICK REVIEW

[論文レビュー] Multi-agent deep reinforcement learning with centralized training and decentralized execution for transportation infrastructure management

Mohammad Saifullah, Konstantinos G. Papakonstantinou|arXiv (Cornell University)|Jan 23, 2024
Infrastructure Maintenance and Monitoring被引用数 4
ひとこと要約

本論文は、不確実性と制約のもとで大規模な交通網の点検・保守を最適化するため、集中学習と分散実行を併用する深層分散型マルチエージェントアクターキャリブレーション(DDMAC-CTDE)フレームワークを提案する。問題を制約付き部分的に観測可能なマルコフ意思決定過程(POMDP)としてモデル化し、バージニア州の96のインfraストラクチャー部材において、近似的最適でスケーラブルな意思決定を実現。従来のポリシー比でコスト効率が7.5–31%優れている。

ABSTRACT

Life-cycle management of large-scale transportation systems requires determining a sequence of inspection and maintenance decisions to minimize long-term risks and costs while dealing with multiple uncertainties and constraints that lie in high-dimensional spaces. Traditional approaches have been widely applied but often suffer from limitations related to optimality, scalability, and the ability to properly handle uncertainty. Moreover, many existing methods rely on unconstrained formulations that overlook critical operational constraints. We address these issues in this work by casting the optimization problem within the framework of constrained Partially Observable Markov Decision Processes (POMDPs), which provide a robust mathematical foundation for stochastic sequential decision-making under observation uncertainties, in the presence of risk and resource limitations. To tackle the high dimensionality of state and action spaces, we propose DDMAC-CTDE, a Deep Decentralized Multi-Agent Actor-Critic (DDMAC) reinforcement learning architecture with Centralized Training and Decentralized Execution (CTDE). To demonstrate the utility of the proposed framework, we also develop a new comprehensive benchmark environment representing an existing transportation network in Virginia, U.S., with heterogeneous pavement and bridge assets undergoing nonstationary degradation. This environment incorporates multiple practical constraints related to budget limits, performance guidelines, traffic delays, and risk considerations. On this benchmark, DDMAC-CTDE consistently outperforms standard transportation management baselines, producing better policies. Together, the proposed framework and benchmark provide (i) a scalable, constraint-aware methodology, and (ii) a realistic, rigorous testbed for comprehensive evaluation of Deep Reinforcement Learning (DRL) for transportation infrastructure management.

研究の動機と目的

  • 高次元の状態空間と行動空間を持つ大規模で多様な交通網を管理するうえで、静的・状態依存・リスクベースの保守ポリシーの限界を解消する。
  • インフラストラクチャー管理を、部分観測と動的劣化を伴う制約付きPOMDPとして定式化することで、従来の最適化手法のスケーラビリティと最適性の問題を克服する。
  • 複数のインフラストラクチャー・エージェント(例:橋梁、舗装)に対して、リアルタイムで制約を考慮した意思決定を可能にするスケーラブルで分散型の強化学習フレームワークを構築する。
  • DRL定式化においてハード制約(例:予算制限)とソフト制約(例:安全目標)を統合し、FHWAおよびVDOT基準への準拠を保証する。
  • バージニア州の実際の96部材ネットワークを対象に、フレームワークの有効性を実証する。初期状態は健全状態と劣化状態の両方を含む。

提案手法

  • インフラストラクチャー管理問題を、確率的劣化、不完全観測、リソース制約を捉える制約付き部分的観測可能なマルコフ意思決定過程(POMDP)として定式化する。
  • グローバル価値関数を用いた共同学習と、局所的状態情報に基づく個別実行を可能にする、新規の深層分散型マルチエージェントアクターキャリブレーション(DDMAC)アルゴリズムを考案。CTDE(集中学習・分散実行)アーキテクチャを採用する。
  • 舗装の劣化ダイナミクスを表すために、クリティカルコンディションインデックス(CCI)と国際的粗さ指数(IRI)を用い、橋梁のデッキ性能を用いて劣化をモデル化する。
  • DRL損失関数にハード制約(例:予算制限)とソフト制約(例:安全目標)を統合し、FHWAおよびVDOT基準に準拠した運用を保証する。
  • 高次元かつ非定常な環境における学習の安定化を図るため、スパarsなパrameterizationと経験再生を組み合わせてDDMAC-CTDEエージェントを訓練する。
  • ネットワークをインフラストラクチャー部材ごとの個別エージェント(橋梁または舗装タイプ)に分解し、各エージェントは局所的観測に基づいて行動するが、集中価値関数のもとで共同で訓練される。

実験結果

リサーチクエスチョン

  • RQ1集中学習・分散実行を併用するマルチエージェント深層強化学習フレームワークは、部分観測と複雑な制約のもとで、大規模で多様な交通網を効果的に管理できるか?
  • RQ2提案されたDDMAC-CTDE手法は、従来の状態依存保守(CBM)および機関推奨ポリシーと比較して、長期的なコストとリスクパフォーマンスで優れているか?
  • RQ3予算制限、安全目標、交通遅延コストといった実世界の制約を、スケーラビリティと最適性を維持したまま処理できるか?
  • RQ4不確実性のもとで、学習されたポリシーは異なるインフラタイプ(例:I型橋梁対二次的舗装)に対して点検・保守行動をどのように優先するか?
  • RQ5初期ネットワーク状態(健全対劣化)が、DDMAC-CTDEポリシーのパフォーマンスとコスト効率に与える影響はいかほどか?

主な発見

  • 健全状態から開始した場合、DDMAC-CTDEフレームワークはヒューリスティックに最適化された状態依存保守(CBM)ポリシー比で総ライフサイクルコストを7.5%削減した。
  • 同じ健全状態から開始した場合、バージニア州交通局(VDOT)が推奨するポリシー基準比でDDMAC-CTDEポリシーは31%安価であった。
  • 2021年のハンプトン・ローズネットワークの実際の状態(非健全)から開始した場合でも、DDMAC-CTDEポリシーは基準を上回り、CBMポリシー比で7.3%、VDOTポリシー比で27%のコスト効率の向上を達成した。
  • フレームワークは、部分観測下でもFHWAおよびVDOTが設定したすべてのパフォーマンス目標と制約目標(安全、予算、リスク閾値)を遵守した。
  • ポリシーのシミュレーションから、高い故障リスクと保守コストを有するI型橋梁および主要舗装の優先的対応が明らかになった。保守行動によりシステムリスクが低下し、リスク曲線に急低下が観察された。
  • コスト配分は橋梁に大きく偏っており、健全状態開始ケースでは最大で総コストの79%を占めた。これは、橋梁の保守およびリスクコストが高いためであり、主要舗装は47部材にわたって数が多く、最大のコスト負担を担っていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。