[논문 리뷰] Can ChatGPT Enable ITS? The Case of Mixed Traffic Control via Reinforcement Learning
이 연구는 지능형 교통 시스템(ITS)에서 혼합 교통 제어를 위한 강화학습(RL) 상태 및 보상 함수를 설계하는 데 비전문가가 ChatGPT(GPT-4)를 활용할 수 있는지 조사한다. 70명의 참가자가 참여한 대규모 사용자 연구에서, ChatGPT는 교차로 시나리오에서 150% 이상, 복잡한 진입로 시나리오에서 136% 이상의 성공적인 RL 정책을 증가시켰으며, 일부 정책은 전문가 수준을 초월하기도 하였다. 그러나 고속도로 환경에서는 향상이 관찰되지 않아, 효과가 환경에 따라 달라지는 것을 확인할 수 있었다.
The surge in Reinforcement Learning (RL) applications in Intelligent Transportation Systems (ITS) has contributed to its growth as well as highlighted key challenges. However, defining objectives of RL agents in traffic control and management tasks, as well as aligning policies with these goals through an effective formulation of Markov Decision Process (MDP), can be challenging and often require domain experts in both RL and ITS. Recent advancements in Large Language Models (LLMs) such as GPT-4 highlight their broad general knowledge, reasoning capabilities, and commonsense priors across various domains. In this work, we conduct a large-scale user study involving 70 participants to investigate whether novices can leverage ChatGPT to solve complex mixed traffic control problems. Three environments are tested, including ring road, bottleneck, and intersection. We find ChatGPT has mixed results. For intersection and bottleneck, ChatGPT increases number of successful policies by 150% and 136% compared to solely beginner capabilities, with some of them even outperforming experts. However, ChatGPT does not provide consistent improvements across all scenarios.
연구 동기 및 목표
- 지능형 교통 시스템(ITS)의 비전문가가 ChatGPT를 사용하여 강화학습 기반 혼합 교통 제어를 위한 효과적인 MDP 구성 요소(상태 및 보상 함수)를 설계할 수 있는지 평가하는 것.
- LLM 지원 없이 비전문가만으로 시도한 경우와 비교해 ChatGPT가 정책 성공률을 얼마나 향상시키는지 평가하는 것.
- ChatGPT를 통해 비전문가가 전문가 수준의 기준을 초월하는 정책을 생성할 수 있는지 조사하는 것.
- 다양한 교통 제어 환경(고속도로, 복잡한 진입로, 교차로)에서 ChatGPT의 효과가 어떻게 변동되는지 분석하는 것.
- 복잡한 ITS 애플리케이션에서 마코프 결정 과정(MDP)을 설정하는 데 있어 LLM이 기술적 장벽을 얼마나 줄이는지 탐색하는 것.
제안 방법
- 70명의 ITS 비전문가를 대상으로 한 대규모 사용자 연구를 실시하였으며, 제어군(LLM 접근 불가)과 연구군(무제한 ChatGPT 접근)으로 나누었다.
- 참가자들은 고속도로, 복잡한 진입로, 교차로의 세 가지 혼합 교통 제어 환경에 대해 상태 및 보상 함수를 설계하였다.
- 일致성을 확보하기 위해 강화학습 기본 원리, MDP 예시, 교통 지표, 환경 기술서를 포함한 표준화된 매뉴얼을 사용하였다.
- 설계된 MDP를 기반으로 RL 정책을 훈련 및 평가하였으며, 표준 교통 지표(예: 유출량, 평균 속도, 대기열 길이)를 통해 성공 여부를 측정하였다.
- 제어군과 연구군 간의 정책 성능을 비교하였으며, 전문가 기준을 비교 기준으로 사용하였다.
- 성공률 향상 정도를 정량화하고, ChatGPT를 통해 도입된 새로운 지표의 사용을 분석하였다.
![Figure 1: Three mixed traffic control environments [ 13 ] (a deep reinforcement learning framework for traffic management), Ring, Bottleneck, and Intersection, are provided to the study participants. Robot vehicles are red and are controlled by learnt RL policies. Human-driven vehicles are white and](https://ar5iv.labs.arxiv.org/html/2306.08094/assets/x1.png)
실험 결과
연구 질문
- RQ1ITS 비전문가가 혼합 교통 제어 문제를 위한 효과적인 MDP 구성 요소(상태 및 보상 함수)를 ChatGPT를 사용해 설계할 수 있는가?
- RQ2LLM 지원 없이 비전문가가 시도한 경우와 비교해 ChatGPT가 성공적인 RL 정책의 수를 유의미하게 증가시키는가?
- RQ3ChatGPT 지원을 받은 정책이 특정 교통 환경에서 전문가 수준의 정책을 초월할 수 있는가?
- RQ4왜 ChatGPT는 일부 환경(예: 교차로, 복잡한 진입로)에서는 성능 향상을 이끌어내지만 다른 환경(예: 고속도로)에서는 그렇지 않은가?
- RQ5참가자의 ChatGPT 사용 패턴이 정책 성공 또는 실패와 얼마나 관련이 있는가?
주요 결과
- 교차로 환경에서는 제어군 대비 ChatGPT 지원으로 성공 정책 수가 150% 증가하였으며, 성공 정책 중 4개는 전문가 기준을 초월하였다.
- 복잡한 진입로 환경에서는 ChatGPT 사용으로 성공 정책 수가 136% 증가하였으며, 연구군은 19개, 제어군은 14개의 성공 정책을 기록하였다.
- ChatGPT는 상태 및 보상 함수에서 새로운 교통 지표 사용을 363% 증가시켰지만, 모든 지표가 성공적인 정책으로 이어지진 않았다.
- 고속도로 환경에서는 ChatGPT가 새로운 지표를 생성하고 응답 품질을 향상시키는 데에도 불구하고, 정책 성공률 향상은 유의미하게 관찰되지 않았다.
- 특히 ChatGPT 지원을 받은 비전문가 정책 중 일부는 전문가 정책을 초월하는 성능을 달성하였으며, 이는 ITS RL 설정에 필요한 전문성에 대한 기존 가정을 도전할 수 있었다.
- ChatGPT의 효과는 참가자의 사용 패턴에 매우 의존적이었으며, 일관되지 않거나 표면적인 프롬프트 입력은 고급 LLM 응답에도 불구하고 결과를 제한하는 경향이 있었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.