[论文解读] Can ChatGPT Enable ITS? The Case of Mixed Traffic Control via Reinforcement Learning
本研究调查了非专家是否能够利用ChatGPT(GPT-4)为智能交通系统(ITS)中的混合交通控制设计有效的强化学习(RL)状态和奖励函数。在70名参与者的大型用户研究中,ChatGPT使交叉路口场景的RL成功策略增加了150%,瓶颈场景增加了136%,部分策略甚至优于专家水平——然而在环形道路环境中未见改进,凸显了其效果具有情境依赖性。
The surge in Reinforcement Learning (RL) applications in Intelligent Transportation Systems (ITS) has contributed to its growth as well as highlighted key challenges. However, defining objectives of RL agents in traffic control and management tasks, as well as aligning policies with these goals through an effective formulation of Markov Decision Process (MDP), can be challenging and often require domain experts in both RL and ITS. Recent advancements in Large Language Models (LLMs) such as GPT-4 highlight their broad general knowledge, reasoning capabilities, and commonsense priors across various domains. In this work, we conduct a large-scale user study involving 70 participants to investigate whether novices can leverage ChatGPT to solve complex mixed traffic control problems. Three environments are tested, including ring road, bottleneck, and intersection. We find ChatGPT has mixed results. For intersection and bottleneck, ChatGPT increases number of successful policies by 150% and 136% compared to solely beginner capabilities, with some of them even outperforming experts. However, ChatGPT does not provide consistent improvements across all scenarios.
研究动机与目标
- 评估非专家是否能够利用ChatGPT设计有效的马尔可夫决策过程(MDP)组件(状态和奖励函数),用于基于强化学习的混合交通控制。
- 评估与仅依赖非专家的尝试相比,ChatGPT在多大程度上提升了策略成功率。
- 探究ChatGPT是否使非专家能够生成优于专家水平基准的策略。
- 分析ChatGPT在不同交通控制环境(环形道路、瓶颈、交叉路口)中效果的差异性。
- 探讨大型语言模型在降低复杂ITS应用中构建马尔可夫决策过程(MDP)的技术门槛方面的作用。
提出的方法
- 开展了一项包含70名非专家的ITS大型用户研究,分为对照组(无LLM访问)和研究组(可无限制使用ChatGPT)。
- 参与者为三种混合交通控制环境(环形道路、瓶颈、交叉路口)设计了状态和奖励函数。
- 使用标准化手册,包含RL基础知识、MDP示例、交通指标和环境描述,以确保一致性。
- 基于所构建的MDP训练并评估RL策略,通过标准交通指标(如出流率、平均速度、队列长度)衡量成功程度。
- 对比对照组与研究组的策略表现,并以专家基准进行比较。
- 量化成功率的提升,并分析通过ChatGPT引入的新指标的使用情况。
![Figure 1: Three mixed traffic control environments [ 13 ] (a deep reinforcement learning framework for traffic management), Ring, Bottleneck, and Intersection, are provided to the study participants. Robot vehicles are red and are controlled by learnt RL policies. Human-driven vehicles are white and](https://ar5iv.labs.arxiv.org/html/2306.08094/assets/x1.png)
实验结果
研究问题
- RQ1非专家是否能够利用ChatGPT为混合交通控制问题设计有效的MDP组件(状态和奖励函数)?
- RQ2与无LLM协助的非专家尝试相比,ChatGPT是否显著增加了成功RL策略的数量?
- RQ3在特定交通环境中,ChatGPT辅助生成的策略是否能够超越专家水平的策略?
- RQ4为何ChatGPT在某些环境(如交叉路口、瓶颈)中提升性能,而在其他环境(如环形道路)中未见提升?
- RQ5参与者使用ChatGPT的模式在多大程度上与策略的成功或失败相关?
主要发现
- 在交叉路口环境中,与对照组相比,ChatGPT协助使成功策略数量增加了150%,其中四个成功策略的表现优于专家基准。
- 在瓶颈环境中,ChatGPT的使用使成功策略数量增加了136%,研究组有19个成功策略,而对照组为14个。
- ChatGPT使状态和奖励函数中新交通指标的使用率提高了363%,尽管并非所有此类指标都导致了成功策略。
- 尽管ChatGPT能够生成新指标并提升响应质量,但在环形道路环境中未观察到策略成功率的显著提升。
- 部分非专家策略——尤其是获得ChatGPT协助的策略——表现超过了专家策略,挑战了ITS RL公式中对专业知识的固有假设。
- ChatGPT的效果高度依赖于参与者的使用模式,不一致或浅层的提示使用限制了结果,即使LLM输出质量较高。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。