Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid Multi-agent Deep Reinforcement Learning for Autonomous Mobility on Demand Systems

Tobias Enders, J. Harrison|arXiv (Cornell University)|2022. 12. 14.
Transportation and Mobility Innovations인용 수 6
한 줄 요약

이 논문은 자율 이동 서비스(AMoD) 시스템에서 사전적이고 수익 최적화된 요청 할당 및 기각을 가능하게 하기 위해 다중 에이전트 소프트 액터-크리틱과 중심화된 가중 이분 매칭을 융합한 하이브리드 다중 에이전트 딥 강화학습 프레임워크를 제안한다. 제안된 방법은 실제 택시 데이터에서 그레디 및 모델 예측 제어(MPC) 기준보다 뛰어난 성능, 안정성, 계산 효율성을 확보하였으며, MPC보다 최대 5% 높은 성능을 기록했고, 테스트 인스턴스 간에 훨씬 일관된 결과를 보였다.

ABSTRACT

We consider the sequential decision-making problem of making proactive request assignment and rejection decisions for a profit-maximizing operator of an autonomous mobility on demand system. We formalize this problem as a Markov decision process and propose a novel combination of multi-agent Soft Actor-Critic and weighted bipartite matching to obtain an anticipative control policy. Thereby, we factorize the operator's otherwise intractable action space, but still obtain a globally coordinated decision. Experiments based on real-world taxi data show that our method outperforms state of the art benchmarks with respect to performance, stability, and computational tractability.

연구 동기 및 목표

  • 대규모이고 시간에 따라 변하는 행동 공간을 가진 자율 이동 서비스(AMoD) 시스템에서 사전적이고 수익 최적화된 요청 할당 및 기각 문제를 해결하기 위해.
  • 대규모 AMoD 시스템에서 중심화된 의사결정의 비가역성 문제를 해결하기 위해 행동 공간을 다중 에이전트 학습을 통해 분해하면서도 전역적 조율를 유지하기 위해.
  • 딥 러닝과 조합 최적화를 동시에 활용하여 실시간 딜리버리 결정을 위한 확장 가능하고 안정적인 강화학습 방법을 개발하기 위해.
  • 제안된 방법을 실제 데이터 기반으로 최신 기준 기반 모델들과 비교하여 성능, 안정성, 계산 타당성 검증을 위해.

제안 방법

  • 논문은 AMoD 딜리버리 문제를 수익 최적화 목표를 가진 마르코프 결정 과정(MDP)으로 수식화한다.
  • 각 차량이 독립된 에이전트로 작동하는 다중 에이전트 소프트 액터-크리틱(SAC) 알고리즘을 적용하며, 분산 정책과 중심화된 크티컬을 통해 가치 추정을 수행한다.
  • 행동 공간은 각 에이전트가 독립적으로 후보 요청을 선택하게 하여 인코딩하고, 이후 중심화된 가중 이분 매칭 단계를 통해 갈등을 해결하고 전역적으로 최적의 할당을 보장한다.
  • 가중 이분 매칭은 SAC 크티컬에서 학습된 상태-행동 가치를 활용하여 고수익·저비용 할당을 우선순위화하여 조율되고 예측 가능한 의사결정을 보장한다.
  • 타겟 네트워크 업데이트에 지수 이동 평균을 사용하고, 각 인스턴스별로 엔트로피 계수를 튜닝하여 탐색과 이용의 균형을 맞춘다.
  • 최종 결정은 후보 매칭에 대해 중심화된 최적화 문제를 풀어 전체 행동 공간을 전부 열거하지 않아도 전역적으로 조율된 딜리버리가 가능하게 한다.

실험 결과

연구 질문

  • RQ1다중 에이전트 딥 강화학습과 중심화된 조합 최적화를 융합한 하이브리드 접근 방식이 기존 기준 대비 더 뛰어난 성능과 안정성을 확보할 수 있는가?
  • RQ2제안된 방법은 실제 교통 조건이 다양할 때 그레디 및 모델 예측 제어(MPC) 접근 방식과 비교해 수익, 계산 효율성, 내구성 측면에서 어떻게 성능을 발휘하는가?
  • RQ3학습 설정을 초월해 차량 및 요청 수가 증가할 경우에도 성능이 일관되게 유지되는가? 이는 확장성과 비모수적 행동을 시사하는가?
  • RQ4이 설정에서 오프-폴리시 액터-크리틱 알고리즘(SAC)이 밸류 기반 다중 에이전트 DRL 방법에 비해 샘플 효율성과 학습 안정성 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 방법은 모든 테스트 인스턴스에서 그레디 기준보다 최대 5% 높은 성능을 기록하여 수익 최적화 측면에서 일관된 성과를 보였다.
  • 대부분의 경우 MPC보다 뚜렷하게 뛰어난 성능을 보였으며, 일부 인스턴스에서는 MPC가 그레디 정책보다 최대 60% 더 열등한 성능을 보여, 실제의 불확실성 하에서 MPC의 불안정성을 확인했다.
  • 다양한 테스트 일자와 시스템 구성에서 뛰어난 성능 안정성을 보였으며, MPC의 예측 불가능한 성능과 대비해 결과의 변동성이 극히 적었다.
  • 학습 시스템보다 더 많은 차량과 요청이 존재하는 시스템에 적용해도 뛰어난 성능 유지를 유지하여 비모수적 확장성과 체계 크기 변화에 대한 강건성을 입증했다.
  • 학습 과정은 안정적인 수렴을 보였으며, 검증 보상이 시간이 지남에 따라 점진적으로 향상되고 양의 값을 도달하여 효과적인 학습이 이루어졌음을 시사했다.
  • 제거 실험 결과, 다중 에이전트 SAC와 중심화된 매칭을 융합한 하이브리드 설계가 핵심임을 확인했으며, 구성 요소를 제거하거나 단순 기준 모델로 대체할 경우 성능이 저하됨을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.