Skip to main content
QUICK REVIEW

[논문 리뷰] Prompt to Transfer: Sim-to-Real Transfer for Traffic Signal Control with Prompt Learning

Longchao Da, Minchiuan Gao|arXiv (Cornell University)|2023. 08. 28.
Traffic Prediction and Management Techniques인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 활용하여 인간의 실제 동적 환경 지식을 통합함으로써 전진 모델 정확도를 향상시키는 프롬프트 기반 추론을 통해 교통 신호 제어의 시뮬레이션에서 실제 환경으로의 전이 성능을 향상시키는 새로운 방법인 PromptGAT을 제안한다. 기상 조건 및 교통 상태와 같은 다양한 조건 하에서 LLM이 유추한 시스템 행동을 기반으로 행동을 정립함으로써, 시뮬레이션과 실제 환경 간의 성능 격차를 줄이며, 다양한 지표에서 기준 방법보다 통계적으로 유의미한 성능 향상을 보였다.

ABSTRACT

Numerous solutions are proposed for the Traffic Signal Control (TSC) tasks aiming to provide efficient transportation and mitigate congestion waste. In recent, promising results have been attained by Reinforcement Learning (RL) methods through trial and error in simulators, bringing confidence in solving cities' congestion headaches. However, there still exist performance gaps when simulator-trained policies are deployed to the real world. This issue is mainly introduced by the system dynamic difference between the training simulator and the real-world environments. The Large Language Models (LLMs) are trained on mass knowledge and proved to be equipped with astonishing inference abilities. In this work, we leverage LLMs to understand and profile the system dynamics by a prompt-based grounded action transformation. Accepting the cloze prompt template, and then filling in the answer based on accessible context, the pre-trained LLM's inference ability is exploited and applied to understand how weather conditions, traffic states, and road types influence traffic dynamics, being aware of this, the policies' action is taken and grounded based on realistic dynamics, thus help the agent learn a more realistic policy. We conduct experiments using DQN to show the effectiveness of the proposed PromptGAT's ability in mitigating the performance gap from simulation to reality (sim-to-real).

연구 동기 및 목표

  • 시뮬레이터에서 훈련된 정책과 실제 환경 적용 간 지속적인 성능 격차를 해소하기 위해.
  • 기존 GAT 방법이 실세계 데이터에만 의존하여 관측되지 않은 또는 희귀 상태에서 실패하는 데서 비롯되는 한계를 극복하기 위해.
  • LLM 을 통한 인간의 도메인 지식 애너테이션을 전진 모델에 통합하여 일반화 및 강건성을 향상시키기 위해.
  • 더 정확하고 현실적인 시스템 동역학 예측 기반으로 행동을 정립함으로써 정책의 전이 가능성 향상시키기 위해.
  • LLM 기반의 동적 프로파일링이 실제 평가에서 성능 격차를 측정 가능한 정도로 감소시킨다는 것을 입증하기 위해.

제안 방법

  • 실세계 시스템 동역학을 모델링하기 위해 LLM을 GAT 프레임워크에 통합한 프롬프트 기반의 행동 정립 프레임워크인 PromptGAT를 도입한다.
  • 기상, 교통 상태, 도로 유형이 교통 동역학에 미치는 영향에 대해 LLM의 추론을 이끌어내기 위해 클로즈 스타일 프롬프트 템플릿을 설계한다.
  • 사전 지식이 없는 상태나 극단적 조건에서의 시스템 행동에 대해 맥락 인식 가능한 추론을 생성하기 위해 체인 오브 톰(Chain-of-Thought) 프롬프트를 활용한다.
  • LLM이 유추한 동역학을 활용해 현재 상태 $s_t$ 와 행동 $a_t$ 에서 다음 상태 $s_{t+1}$ 를 예측하는 전진 모델 $f_{\phi^{+}}$ 를 향상시킨다.
  • 향상된 전진 모델을 활용해 실제 세계에서 행동을 정립함으로써, 정책이 더 현실적인 행동을 학습할 수 있도록 한다.
  • 정착된 행동을 사용하여 DQN 에이전트를 훈련시켜 시뮬레이션에서 실제 유사 환경으로의 전이 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1실세계 데이터에 잘 반영되지 않은 희귀하거나 극단적 조건에서 LLM이 실세계 교통 동역학을 효과적으로 모델링할 수 있는가?
  • RQ2프롬프트 기반 LLM 추론이 데이터 중심 접근 방식에 비해 GAT의 전진 모델 정확도를 어떻게 향상시키는가?
  • RQ3향상된 전진 모델 정확도가 시뮬레이션과 실제 환경 평가 간 성능 격차를 어느 정도 감소시키는가?
  • RQ4LLM 을 통한 인간 지식 통합이 더 강건하고 일반화 능력이 뛰어난 교통 신호 제어 정책을 이끌어내는가?
  • RQ5전진 모델 정확도 향상과 평균 이동 시간, 대기열 길이 등의 핵심 지표에서 성능 격차 감소 간 상관관계는 어떻게 되는가?

주요 결과

  • PromptGAT 는 Direct Transfer 와 VanillaGAT 에 비해 실제 평가($E_{\text{real}}$)에서 성능 격차를 유의미하게 줄였으며, 모든 지표에서 통계적으로 유의미한 향상을 보였다.
  • PromptGAT 의 전진 모델 예측 오차는 VanillaGAT 보다 일관되게 낮아, 실세계 동역학을 모델링하는 데서 더 높은 정확도를 입증했다.
  • 평균 이동 시간, 처리량, 대기열 길이 등에서 전진 모델 정확도 향상과 성능 격차 감소 사이에 강한 정적 상관관계(p ≤ 0.001)가 존재한다.
  • 전진 모델 정확도 향상과 성능 격차 완화 간 피어슨 상관계수 $r$ 는 모든 지표에서 0.8 초과를 기록하여 높은 일관성과 신뢰성을 보였다.
  • 사례 연구 결과, PromptGAT 가 극단적 조건(예: 악천후)에 대해 추론할 수 있는 능력 덕분에 더 정확한 행동 정립과 더 나은 정책 일반화가 가능함을 확인했다.
  • 모든 실험은 재현 가능한 설정을 기반으로 한 시뮬레이션-시뮬레이션 환경에서 수행되었으며, 코드와 데이터는 공개되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.