Skip to main content
QUICK REVIEW

[论文解读] Two Phase $Q-$learning for Bidding-based Vehicle Sharing

Yinlam Chow, Jia Yuan Yu|arXiv (Cornell University)|Sep 29, 2015
Transportation and Mobility Innovations参考文献 25被引用 3
一句话总结

本文提出了一种用于基于出价的车辆共享系统的两阶段Q-learning算法,其中客户提交出价,运营商通过最优分配租赁以最大化收入,同时强制执行车辆利用率约束。该方法将问题建模为带约束的马尔可夫决策过程(CMDP),推导出两阶段贝尔曼最优性条件,并通过数值实验表明,与惩罚Q-learning或拉格朗日演员-critic方法等替代方案相比,该算法收敛更快且更严格地满足服务约束。

ABSTRACT

We consider one-way vehicle sharing systems where customers can rent a car at one station and drop it off at another. The problem we address is to optimize the distribution of cars, and quality of service, by pricing rentals appropriately. We propose a bidding approach that is inspired from auctions and takes into account the significant uncertainty inherent in the problem data (e.g., pick-up and drop-off locations, time of requests, and duration of trips). Specifically, in contrast to current vehicle sharing systems, the operator does not set prices. Instead, customers submit bids and the operator decides whether to rent or not. The operator can even accept negative bids to motivate drivers to rebalance available cars to unpopular destinations within a city. We model the operator's sequential decision-making problem as a \emph{constrained Markov decision problem} (CMDP) and propose and rigorously analyze a novel two phase $Q$-learning algorithm for its solution. Numerical experiments are presented and discussed.

研究动机与目标

  • 通过用拍卖式出价机制替代固定定价,解决单向车辆共享系统中的供需失衡问题。
  • 将运营商的序列决策建模为带约束的马尔可夫决策过程(CMDP),目标是最大化收入并满足车辆利用率约束。
  • 开发一种基于采样的两阶段Q-learning算法,在较弱假设下收敛至最优策略。
  • 通过实证评估该算法与现有方法(包括惩罚Q-learning和拉格朗日演员-critic方法)的性能对比。
  • 提供一种理论基础坚实、可扩展的解决方案,以减少对司机和停车空间过载的依赖。

提出的方法

  • 运营商采用出价机制,客户提交出价,运营商决定接受哪些出价,从而实现动态定价和再平衡激励。
  • 将问题表述为CMDP,其中动作对应于基于出价的租赁分配决策,目标是在满足最低平均车辆利用率约束的前提下最大化总收入。
  • 推导出两阶段贝尔曼最优性条件,表明CMDP可通过两阶段动态规划求解:首先在给定拉格朗日乘子下求解值函数,然后优化该乘子。
  • 所提出的两阶段Q-learning算法在租赁决策的Q函数更新与用于强制执行利用率约束的拉格朗日乘子调整之间交替进行。
  • 在每次迭代中,分配子问题被建模为双线性整数线性规划(BILP),可使用标准求解器(如CPLEX)求解中等规模问题。
  • 该算法在较弱正则性条件下,渐近收敛至CMDP最优解,且收敛速度优于基于演员-critic的拉格朗日方法。

实验结果

研究问题

  • RQ1出价机制能否有效替代单向车辆共享系统中的固定定价,以提升系统效率并降低运营成本?
  • RQ2运营商在收入和利用率约束下的序列决策应如何最优地建模为带约束的马尔可夫决策过程(CMDP)?
  • RQ3在此情境下,CMDP最优策略的理论结构是什么?能否分解为两阶段动态规划过程?
  • RQ4与惩罚Q-learning和拉格朗日演员-critic方法相比,所提出的两阶段Q-learning算法在收敛速度和约束满足方面表现如何?
  • RQ5该算法能否在保持性能保证的前提下扩展至中等规模的车辆共享系统?

主要发现

  • 两阶段Q-learning算法相比无约束Q-learning的总收入减少了20%,但确保了平均车辆利用率时间达到2.5小时,满足了最低利用率约束。
  • 该算法收敛速度优于拉格朗日演员-critic方法,后者需要顺序梯度近似且对学习率调整敏感。
  • 惩罚Q-learning实现了最高的平均利用率(2.73小时),但收入差距高达28%,表明利用率与收入之间存在权衡。
  • 所提方法在平衡收入与约束合规性方面优于惩罚Q-learning和拉格朗日演员-critic方法。
  • 该算法成功求解了包含最多50辆车、20个站点和12小时时间范围的中等规模问题,BILP子问题使用CPLEX求解。
  • 在较弱假设下,该算法的理论收敛性已证明可达到CMDP最优解,为实际部署提供了坚实基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。