[논문 리뷰] Scalable Multi-Agent Reinforcement Learning for Warehouse Logistics with Robotic and Human Co-Workers
이 논문은 중앙 관리자가 로봇 및 인간 작업자에게 작업을 할당하여 주문 창고의 물류 성능을 최적화하는 계층적 다중 에이전트 강화학습(MARL) 프레임워크를 제안한다. 관리자-작업자 계층 구조를 통해 큰 행동 공간을 분해함으로써, 다양한 창고 구성에서 산업 히우리즘 대비 최대 41.3% 높은 피킹 속도를 달성하면서도 샘플 효율성과 확장성을 유지한다.
We consider a warehouse in which dozens of mobile robots and human pickers work together to collect and deliver items within the warehouse. The fundamental problem we tackle, called the order-picking problem, is how these worker agents must coordinate their movement and actions in the warehouse to maximise performance in this task. Established industry methods using heuristic approaches require large engineering efforts to optimise for innately variable warehouse configurations. In contrast, multi-agent reinforcement learning (MARL) can be flexibly applied to diverse warehouse configurations (e.g. size, layout, number/types of workers, item replenishment frequency), and different types of order-picking paradigms (e.g. Goods-to-Person and Person-to-Goods), as the agents can learn how to cooperate optimally through experience. We develop hierarchical MARL algorithms in which a manager agent assigns goals to worker agents, and the policies of the manager and workers are co-trained toward maximising a global objective (e.g. pick rate). Our hierarchical algorithms achieve significant gains in sample efficiency over baseline MARL algorithms and overall pick rates over multiple established industry heuristics in a diverse set of warehouse configurations and different order-picking paradigms.
연구 동기 및 목표
- 혼합된 로봇 및 인간 작업자가 참여하는 창고에서 주문 피킹을 위한 확장 가능하고 일반적인 다중 에이전트 강화학습(MARL) 솔루션을 개발하기 위해.
- 변동하는 창고 레이아웃, 크기, 운영 제약 조건에 맞게 전통적인 히우리즘 방법을 적용하기 위해 요구되는 높은 엔지니어링 노력 문제를 줄이기 위해.
- 계층적 정책 분해를 통해 복잡하고 동적인 창고 환경에서 샘플 효율성과 전체 피킹 속도를 향상시키기 위해.
- 다양한 창고 구성에서 기존 산업 히우리즘(PDM 및 FM)을 능가하면서도 다양한 최적화 목표에 유연하게 대응할 수 있도록 하기 위해.
- 수동 재설계 없이도 변화하는 창고 조건에 자동으로 적응하는 정책 학습을 가능하게 하기 위해.
제안 방법
- 중앙 관리자가 작업자 에이전트(피커 및 AGV)에게 목표를 할당하는 계층적 MARL 아키텍처를 설계하여 공동 행동 공간의 복잡성을 감소시키기 위해.
- 전체 시스템 성능을 최대화하기 위해 전역 보상 신호(예: 피킹 속도)를 사용하여 관리자 및 작업자 정책을 종합적으로 끝내기까지 훈련시키기 위해.
- 3개의 기존 MARL 알고리즘인 독립형 액터-크리틱(IAC), 공유 네트워크 액터-크리틱(SNAC), 공유 경험 액터-크리틱(SEAC) 위에 계층적 프레임워크를 통합하기 위해.
- 실제 창고 동역학을 모델링하기 위해 고정밀도 및 시뮬레이션 최적화 환경을 사용하여 항목 재충전, 에이전트 이동, 주문 완료 등을 포함하기 위해.
- 훈련 안정성과 확장성 향상을 위해 창고를 동일한 크기의 영역(Y)으로 공간 분할하기 위해.
- 경험 재생과 타겟 네트워크를 사용한 딥 강화학습으로 정책을 훈련시키며, 주로 시간당 피킹 라인 수를 최적화 목표로 삼기 위해.
실험 결과
연구 질문
- RQ1비계층적 MARL 기준선 대비 계층적 MARL 접근 방식이 복잡한 다중 에이전트 창고 물류 환경에서 샘플 효율성과 전체 피킹 속도를 크게 향상시킬 수 있는가?
- RQ2다양한 창고 구성(소형, 중형, 대형, 분리형 레이아웃 포함)에서 계층적 MARL이 기존 산업 히우리즘(PDM 및 FM)을 어느 정도 능가할 수 있는가?
- RQ3행동 공간의 계층적 분해가 혼합된 로봇 및 인간 창고 팀에서 성능, 이동 거리, 정지 시간 간의 트레이드오프에 어떤 영향을 미치는가?
- RQ4재훈련 없이도 다양한 창고 크기, 에이전트 수, 항목 분포 패턴에 대해 제안된 방법이 일반화 가능한가?
- RQ5학습된 정책의 뜻하지 않은 결과로는 이동 거리 증가나 정지 시간 감소 등이 있으며, 이러한 요소들이 운영 비용과 작업자 복지에 어떤 영향을 미치는가?
주요 결과
- 계층적 MARL 알고리즘(HIAC, HSNAC, HSEAC)은 모든 테스트된 창고 구성에서 비계층적 MARL 기준선(IAC, SNAC, SEAC)과 산업 히우리즘(PDM 및 FM)을 일관되게 능가했다.
- 분리형 레이아웃에서 HSEAC는 FM 히우리즘 대비 41.3% 높은 피킹 속도를 기록했으며, PDM 대비 18.6% 향상되어 복잡한 레이아웃에서의 강력한 일반화 능력을 입증했다.
- 대형 레이아웃에서 HSEAC는 FM 대비 11.4% 높고, PDM 대비 22.0% 높은 성능을 보여, 고복잡도 환경에서의 계층적 접근의 확장성 잠재력을 입증했다.
- 계층적 알고리즘은 비계층적 대비 상당히 더 빠른 수렴 속도를 보였으며, 특히 더 크고 복잡한 환경에서 샘플 효율성이 향상됨을 시사했다.
- 피킹 속도는 상당히 높아졌지만, 학습된 정책은 총 이동 거리를 늘리고 피커의 정지 시간을 줄여 유지보수 비용과 작업자 복지에 잠재적 트레이드오프를 유도할 수 있다.
- 작업 난이도가 낮은 소형 레이아웃에서는 IAC가 계층적 방법과 유사한 성능(2.2% 이내의 차이)을 보였으며, 이는 계층적 이점이 주로 복잡한 환경에서 나타남을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.