[论文解读] Real-world Ride-hailing Vehicle Repositioning using Deep Reinforcement Learning
本文提出了一种基于决策时间规划的深度强化学习框架,用于现实世界网约车车辆再定位,通过批量训练学习时空状态值函数,并按需生成最优再定位动作。该方法在模拟环境和真实世界实地测试中均展现出优于人类专家的每小时收入表现,且驾驶员为常规司机。
We present a new practical framework based on deep reinforcement learning and decision-time planning for real-world vehicle repositioning on ride-hailing (a type of mobility-on-demand, MoD) platforms. Our approach learns the spatiotemporal state-value function using a batch training algorithm with deep value networks. The optimal repositioning action is generated on-demand through value-based policy search, which combines planning and bootstrapping with the value networks. For the large-fleet problems, we develop several algorithmic features that we incorporate into our framework and that we demonstrate to induce coordination among the algorithmically-guided vehicles. We benchmark our algorithm with baselines in a ride-hailing simulation environment to demonstrate its superiority in improving income efficiency meausred by income-per-hour. We have also designed and run a real-world experiment program with regular drivers on a major ride-hailing platform. We have observed significantly positive results on key metrics comparing our method with experienced drivers who performed idle-time repositioning based on their own expertise.
研究动机与目标
- 通过优化闲置时间的车辆再定位策略,提升网约车司机的收入效率。
- 为小型车队(单个司机)和大型车队(全市范围)再定位场景开发可扩展的框架。
- 利用学习到的价值网络和规划技术,实现实时、按需的再定位决策。
- 在大型车队场景中协调车辆移动,防止拥堵并提升整体系统效率。
- 通过在主流网约车平台上的模拟和真实世界实地实验验证该方法。
提出的方法
- 该框架基于历史网约车数据,通过离线批量训练学习基于深度Q网络的状态值函数。
- 通过基于值的策略搜索按需生成最优再定位动作,结合规划与训练好的值网络的自举法。
- 引入长距离搜索机制,在标准搜索失败时引导司机离开低需求区域,提升稀疏区域的再定位成功率。
- 将供需(SD)信息融入状态表示,以增强响应速度,并在大型车队场景中实现车辆间的协调。
- 通过扩展Q值网络中的状态特征,支持单人乘坐和拼车模式。
- 该算法作为AI司机助手部署,实时提出动作并由司机决定是否接受,接受概率建模为任务接受概率 $p_a$。
实验结果
研究问题
- RQ1基于决策时间规划的深度强化学习能否在真实世界网约车车辆再定位中超越人类专家策略?
- RQ2如何设计统一框架,有效应对单个司机再定位与大规模车队协调的双重需求?
- RQ3供需状态信息在实现协调性、系统级再定位中发挥何种作用?
- RQ4长距离搜索机制在引导司机从低需求区域前往高需求区域方面的有效性如何?
- RQ5与经验丰富的司机相比,AI助手在提升每小时收入方面有多大的改善?
主要发现
- 在真实世界实地测试中,所提方法实现的每小时收入显著高于经验丰富的司机,且司机报告高度满意,并表示愿意再次参与。
- 长距离搜索机制成功将司机从偏远低需求区域重新定位至市中心,有效防止了在低效区域的长时间闲置。
- 在模拟基准测试中,该算法在提升每小时收入方面优于多个基线方法,展现出卓越的效率。
- 该框架在大型车队场景中有效协调了车辆移动,通过具备供需感知的状态表示,避免了高需求地点的拥堵。
- 即使司机拒绝再定位任务,系统仍保持高性能,通过基于接受概率 $p_a$ 的简单折扣机制调整动作价值。
- 对司机轨迹的分析表明,长距离搜索很少被触发,说明常规搜索算法已能处理大多数情况,但长距离搜索在罕见但高影响的场景中至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。