Skip to main content
QUICK REVIEW

[논문 리뷰] Same-Day Delivery with Fairness

Xinwei Chen, Tong Wang|arXiv (Cornell University)|2020. 07. 19.
Transportation and Mobility Innovations참고 문헌 20인용 수 12
한 줄 요약

이 논문은 전반적인 서비스 유틸리티와 지리적 공정성—지역 간 서비스율의 최소값으로 정의된 공정성—을 균형 잡는 데 깊이 있는 Q학습 방법을 제안한다. 요청 기반 학습에서 증분 서비스 기반 학습으로의 새로운 변환을 도입함으로써 학습을 안정화하고, 전체 서비스율을 5%에서 46%로 높일 때 유틸리티 손실이 단 6.2%에 그치는 바람에 공정성 향상 효과를 크게 달성한다.

ABSTRACT

The demand for same-day delivery (SDD) has increased rapidly in the last few years and has particularly boomed during the COVID-19 pandemic. The fast growth is not without its challenge. In 2016, due to low concentrations of memberships and far distance from the depot, certain minority neighborhoods were excluded from receiving Amazon's SDD service, raising concerns about fairness. In this paper, we study the problem of offering fair SDD-service to customers. The service area is partitioned into different regions. Over the course of a day, customers request for SDD service, and the timing of requests and delivery locations are not known in advance. The dispatcher dynamically assigns vehicles to make deliveries to accepted customers before their delivery deadline. In addition to the overall service rate (utility), we maximize the minimal regional service rate across all regions (fairness). We model the problem as a multi-objective Markov decision process and develop a deep Q-learning solution approach. We introduce a novel transformation of learning from rates to actual services, which creates a stable and efficient learning process. Computational results demonstrate the effectiveness of our approach in alleviating unfairness both spatially and temporally in different customer geographies. We also show this effectiveness is valid with different depot locations, providing businesses with an opportunity to achieve better fairness from any location. Further, we consider the impact of ignoring fairness in service, and results show that our policies eventually outperform the utility-driven baseline when customers have a high expectation on service level.

연구 동기 및 목표

  • 아마존이 소수 민족 거주 지역의 회원 밀도와 물류센터와의 거리가 낮아 배제된 사례처럼, 동일일 배송(SDD) 서비스에서 증가하는 공간적 불균형 문제를 다루기 위해.
  • 전반적인 서비스율(유틸리티)과 최소 지역 서비스율(공정성)을 동시에 최대화하는 다목적 SDD 문제를 수립하여, 다양한 지리적 지역 간 공정한 접근을 보장하기 위해.
  • 시간 소모적인 재최적화를 피하고 실시간 차량 경로 최적화를 지원하는 확장 가능하고 실시간 의사결정 프레임워크를 개발하기 위해.
  • 요율 기반 목표 함수 학습의 불안정성을 해결하기 위해, 분모가 변하는 요율이 아닌 증분 서비스 단위를 사용하는 새로운 변환을 도입함으로써 안정적이고 효율적인 딥 강화학습을 가능하게 하기 위해.

제안 방법

  • 전체 서비스율의 기대값과 최소 지역 서비스율의 가중 조합을 사용하여 다목적 마코프 결정 과정(MDP)으로 SDD 문제를 모델링한다.
  • 신경망을 사용하여 Q값을 근사함으로써 오프라인 정책 학습과 재최적화 없이 실시간 추론을 가능하게 하는 딥 Q학습을 사용한다.
  • 목표 함수의 새로운 변환을 도입: 분모가 변하는 요율을 최적화하는 대신 증분 서비스 단위를 최적화함으로써 학습 안정성 향상과 수렴성 향상이 가능하다.
  • 현재 차량 위치, 보류 중인 요청, 시간대, 지역 수요 패턴을 포함한 동적 정보를 반영한 상태 표현을 정의한다.
  • 유틸리티(수락된 요청 수)와 공정성(낮은 지역 서비스율에 대한 벌점)을 조합한 보상 함수를 사용하며, 조정 가능한 트레이드오프 가중치를 제공한다.
  • 다양한 물류센터 위치와 수요 분포를 가진 합성 및 실제 고객 지리에서 방법을 검증한다.

실험 결과

연구 질문

  • RQ1강화학습 기반 접근법이 실시간 성능을 희생시키지 않고 유틸리티와 공정성을 효과적으로 균형 잡을 수 있는가?
  • RQ2요율 기반 최적화에 비해 요청 기반 학습에서 증분 서비스 기반 학습으로의 제안된 변환이 학습 안정성과 정책 성능에 어떻게 기여하는가?
  • RQ3이러한 방법은 다양한 고객 지리에서 동일일 배송 서비스 가용성의 공간적·시간적 불공정성을 어느 정도 감소시킬 수 있는가?
  • RQ4특히 높은 서비스 수준 기대치가 존재하는 상황에서, SDD 서비스 설계에서 공정성을 忽시할 경우 장기적으로 어떤 영향을 미치는가?
  • RQ5제안된 방법은 기존 또는 최적화되지 않은 물류센터 구성에서 물류센터 위치 결정과 유틸리티 및 공정성 간의 트레이드오프에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 다양한 지리적 지역에서 SDD 서비스 배달의 불공정성을 줄이며, 전체 유틸리티 손실이 단 6.2%에 그치는 동안 최소 지역 서비스율을 46%까지 끌어올린다.
  • 고객의 서비스 수준 기대치가 높을 경우(예: 70% 기준), 공정성 인식 정책은 유틸리티 전용 기준 대비 장기적인 시점에서 공정성과 전체 유틸리티 양면에서 뛰어난 성능을 보인다.
  • 공정성 트레이드오프 가중치 α=0.5를 가진 정책은 1년간의 시뮬레이션 동안 안정적인 성능을 유지하는 반면, 유틸리티 전용 기준은 서비스 수요가 낮은 지역에서 고객을 잃고 성능 저하를 겪는다.
  • 공정성 인식 정책은 특히 수요가 낮거나 외곽 지역에서 높은 서비스 수준을 유지하며, 더 높은 서비스 수준 기대치에 도달할 때까지 성능 저하를 연기한다.
  • 이 방법은 물류센터를 이전하지 않고도 기존 물류센터 위치에서 더 공정한 서비스를 달성할 수 있게 하여, 물리적 물류센터 이전 대비 공정성 확보 비용을 줄인다.
  • 공정성을 忽시할 경우, 단기적으로 유틸리티가 더 높더라도 장기적으로는 서비스 수요가 낮은 지역에서 고객 이탈이 발생해 수익 손실이 발생한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.