[論文レビュー] Prompt to Transfer: Sim-to-Real Transfer for Traffic Signal Control with Prompt Learning
本稿では、大規模言語モデル(LLM)を用いたプロンプトベースの推論により、現実世界のダイナミクスに関する人間の知識を統合することで、前方モデルの精度を向上させることで、シミュレーションから現実への転送性能を向上させる新規なシミュレーションから現実への転送手法であるPromptGATを提案する。天候や交通状態などの異なる条件下でのLLMが推論するシステム行動に基づいて行動をグランドリングすることで、シミュレーションと現実の間の性能ギャップを低減し、複数の指標においてベースライン手法を上回る統計的に有意な改善を達成する。
Numerous solutions are proposed for the Traffic Signal Control (TSC) tasks aiming to provide efficient transportation and mitigate congestion waste. In recent, promising results have been attained by Reinforcement Learning (RL) methods through trial and error in simulators, bringing confidence in solving cities' congestion headaches. However, there still exist performance gaps when simulator-trained policies are deployed to the real world. This issue is mainly introduced by the system dynamic difference between the training simulator and the real-world environments. The Large Language Models (LLMs) are trained on mass knowledge and proved to be equipped with astonishing inference abilities. In this work, we leverage LLMs to understand and profile the system dynamics by a prompt-based grounded action transformation. Accepting the cloze prompt template, and then filling in the answer based on accessible context, the pre-trained LLM's inference ability is exploited and applied to understand how weather conditions, traffic states, and road types influence traffic dynamics, being aware of this, the policies' action is taken and grounded based on realistic dynamics, thus help the agent learn a more realistic policy. We conduct experiments using DQN to show the effectiveness of the proposed PromptGAT's ability in mitigating the performance gap from simulation to reality (sim-to-real).
研究の動機と目的
- シミュレーションで訓練されたポリシーと現実世界への展開との間の継続的な性能ギャップを是正すること。
- 現実世界のデータに依存する従来のGAT手法が、観測されないまたはレアな状態で失敗するという制限を克服すること。
- LLMによる人間がアノテートしたドメイン知識を前方モデルに統合することで、一般化性とロバスト性を向上させること。
- より正確で現実的なシステムダイナミクス予測に基づいて行動をグランドリングすることで、ポリシーの転送性を向上させること。
- LLMベースの動的プロファイル化が、現実評価における性能ギャップの測定可能な低減をもたらすことを実証すること。
提案手法
- LLMをGATフレームワークに統合して現実世界のシステムダイナミクスをモデル化する、プロンプトベースのグランドリング行動変換フレームワークであるPromptGATを導入する。
- 天候、交通状態、道路種別が交通ダイナミクスに与える影響について、LLMの推論を引き出すためのクローズ型プロンプトテンプレートを設計する。
- チェーン・オブ・トゥーク(Chain-of-Thought)プロンプトを用いて、未観測または極端な状態下でのシステム行動に関する詳細で文脈に即した推論を生成する。
- LLMが推論したダイナミクスを用いて、現在の状態 $s_t$ と行動 $a_t$ から次の状態 $s_{t+1}$ を予測する前方モデル $f_{\phi^{+}}$ を改善する。
- 強化された前方モデルを用いて、現実世界の行動をグランドリングし、ポリシーがより現実的な行動を学習できるようにする。
- グランドリングされた行動を用いてDQNエージェントを訓練し、シミュレーションから現実に近い環境への転送性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1LLMは、現実世界のデータに十分に反映されていないレアまたは極端な状態下での現実世界の交通ダイナミクスを効果的にモデル化できるか?
- RQ2データのみに依存するアプローチと比較して、プロンプトベースのLLM推論は、GATにおける前方モデルの精度をどのように向上させるか?
- RQ3向上した前方モデルの精度が、シミュレーションと現実世界評価の間の性能ギャップをどの程度低減するか?
- RQ4LLMによる人間の知識の統合は、よりロバストで一般化性の高い交通信号制御ポリシーをもたらすか?
- RQ5前方モデルの精度向上と、平均移動時間やキュー長などの主要指標における性能ギャップ低減の間には、どの程度の相関関係があるか?
主な発見
- PromptGATは、Direct Transfer や VanillaGAT と比較して、現実評価($E_{\text{real}}$)における性能ギャップを顕著に低減し、すべての指標で統計的に有意な改善を示した。
- PromptGATにおける前方モデルの予測誤差は、VanillaGAT よりも一貫して低く、現実世界のダイナミクスをモデル化する精度の向上を示している。
- 平均移動時間、スループット、キュー長の各指標において、前方モデルの精度向上と性能ギャップ低減の間に強い正の相関(p ≤ 0.001)が存在する。
- 前方モデルの精度向上と性能ギャップ低減の関係におけるピアソン相関係数 $r$ は、すべての指標で0.8を超えており、高い一貫性と信頼性を示している。
- 事例研究では、PromptGATが極端な状態(例:悪天候)についての推論が可能であることが判明し、より正確な行動グランドリングとより良いポリシーの一般化を実現している。
- すべての実験は再現可能な設定のシミュレーションからシミュレーションの設定で実施され、コードとデータは公開されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。