[论文解读] Prompt to Transfer: Sim-to-Real Transfer for Traffic Signal Control with Prompt Learning
该论文提出 PromptGAT,一种用于交通信号控制的新型仿真到现实迁移方法,通过基于提示的推理利用大型语言模型(LLMs)来提升前向模型的准确性,从而整合现实世界动态的人类知识。通过在不同条件(如天气和交通状态)下利用 LLM 推断的系统行为对动作进行定位,PromptGAT 减少了仿真与现实之间的性能差距,在多个指标上显著优于基线方法。
Numerous solutions are proposed for the Traffic Signal Control (TSC) tasks aiming to provide efficient transportation and mitigate congestion waste. In recent, promising results have been attained by Reinforcement Learning (RL) methods through trial and error in simulators, bringing confidence in solving cities' congestion headaches. However, there still exist performance gaps when simulator-trained policies are deployed to the real world. This issue is mainly introduced by the system dynamic difference between the training simulator and the real-world environments. The Large Language Models (LLMs) are trained on mass knowledge and proved to be equipped with astonishing inference abilities. In this work, we leverage LLMs to understand and profile the system dynamics by a prompt-based grounded action transformation. Accepting the cloze prompt template, and then filling in the answer based on accessible context, the pre-trained LLM's inference ability is exploited and applied to understand how weather conditions, traffic states, and road types influence traffic dynamics, being aware of this, the policies' action is taken and grounded based on realistic dynamics, thus help the agent learn a more realistic policy. We conduct experiments using DQN to show the effectiveness of the proposed PromptGAT's ability in mitigating the performance gap from simulation to reality (sim-to-real).
研究动机与目标
- 解决在交通信号控制中,基于仿真训练的策略与真实世界部署之间持续存在的性能差距问题。
- 克服传统 GAT 方法仅依赖真实世界数据的局限性,这些方法在未观测或罕见状态下的表现不佳。
- 通过 LLM 将人工标注的领域知识整合到前向模型中,以提升泛化能力和鲁棒性。
- 通过基于更准确和现实的系统动态预测来定位动作,提升策略的可迁移性。
- 证明基于 LLM 的动态建模能够显著降低真实世界评估中的性能差距。
提出的方法
- 提出 PromptGAT,一种基于提示的、动作定位的框架,将 LLM 集成到 GAT 框架中,以建模真实世界的系统动态。
- 设计了一种填空式提示模板,以激发 LLM 对天气、交通状态和道路类型如何影响交通动态的推理。
- 采用思维链提示(chain-of-thought prompting)生成关于在未见或极端条件下系统行为的详细、上下文感知的推断。
- 利用 LLM 推断的动态信息改进前向模型 $f_{\phi^{+}}$,该模型从当前状态 $s_t$ 和动作 $a_t$ 预测下一状态 $s_{t+1}$。
- 将增强后的前向模型应用于真实世界中的动作定位,使策略能够学习到更真实的动态行为。
- 使用定位后的动作训练 DQN 代理,从而提升从仿真到类真实世界环境的迁移性能。
实验结果
研究问题
- RQ1LLM 是否能有效建模在真实世界数据中未充分表示的罕见或极端条件下现实世界的交通动态?
- RQ2与仅依赖数据的方法相比,基于提示的 LLM 推理在 GAT 中如何提升前向模型的准确性?
- RQ3前向模型准确性提升在多大程度上减少了仿真与真实世界评估之间的性能差距?
- RQ4通过 LLM 整合人类知识是否能带来更鲁棒和泛化能力更强的交通信号控制策略?
- RQ5前向模型准确性提升与关键指标(如平均行程时间、队列长度)上性能差距减少之间是否存在相关性?
主要发现
- 与直接迁移(Direct Transfer)和 VanillaGAT 相比,PromptGAT 在真实世界评估($E_{\text{real}}$)中显著减少了性能差距,所有指标均表现出统计显著的改进。
- PromptGAT 的前向模型预测误差始终低于 VanillaGAT,证明其在建模真实世界动态方面具有更高的准确性。
- 前向模型准确性提升与平均行程时间、吞吐量和队列长度等指标上性能差距减少之间存在强正相关性(p ≤ 0.001)。
- 前向模型准确性提升与性能差距缓解之间的皮尔逊相关系数 $r$ 在所有指标中均超过 0.8,表明高度一致性和可靠性。
- 案例研究显示,PromptGAT 在极端条件(如恶劣天气)下推理能力更强,从而实现更准确的动作定位和更好的策略泛化能力。
- 所有实验均在仿真到仿真的设置下进行,配置可复现,代码和数据已公开。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。