[论文解读] Optimizing Taxi Carpool Policies via Reinforcement Learning and Spatio-Temporal Mining
本文提出一种结合时空神经网络(ST-NN)的强化学习(RL)框架,以优化出租车拼车政策,提升交通效率。ST-NN 直接从原始 GPS 数据预测行程时间和距离,无需特征工程;而 RL 代理则学习在何时接受拼车请求以最大化有效行程距离。该方法在低需求区域(如曼哈顿上城)显著优于固定策略和表格 Q 策略,展现出更优的长期效率与更少的交通拥堵。
In this paper, we develop a reinforcement learning (RL) based system to learn an effective policy for carpooling that maximizes transportation efficiency so that fewer cars are required to fulfill the given amount of trip demand. For this purpose, first, we develop a deep neural network model, called ST-NN (Spatio-Temporal Neural Network), to predict taxi trip time from the raw GPS trip data. Secondly, we develop a carpooling simulation environment for RL training, with the output of ST-NN and using the NYC taxi trip dataset. In order to maximize transportation efficiency and minimize traffic congestion, we choose the effective distance covered by the driver on a carpool trip as the reward. Therefore, the more effective distance a driver achieves over a trip (i.e. to satisfy more trip demand) the higher the efficiency and the less will be the traffic congestion. We compared the performance of RL learned policy to a fixed policy (which always accepts carpool) as a baseline and obtained promising results that are interpretable and demonstrate the advantage of our RL approach. We also compare the performance of ST-NN to that of state-of-the-art travel time estimation methods and observe that ST-NN significantly improves the prediction performance and is more robust to outliers.
研究动机与目标
- 开发一种数据驱动的拼车政策,以最大化城市出租车系统中的交通效率并最小化交通拥堵。
- 解决在动态城市环境中,仅使用原始 GPS 数据准确估算行程时间和距离的挑战。
- 设计一种强化学习框架,基于实时司机状态和未来需求前景,学习最优拼车接受决策。
- 在不同出租车需求密度的城市区域中,评估 RL 策略相较于固定策略和表格 Q 策略的性能表现。
- 证明 ST-NN 模型在无需人工特征工程的情况下,对行程时间和距离预测的鲁棒性与可扩展性。
提出的方法
- 开发了一种时空神经网络(ST-NN),以出发地和目的地的原始 GPS 坐标及一天中的时间作为输入,直接预测行程时间和距离,无需构建路线或地图。
- 利用纽约市出租车行程数据构建了拼车模拟环境,其中 ST-NN 提供行程时间估计,RL 代理根据状态转移选择动作。
- 将拼车决策问题建模为马尔可夫决策过程(MDP),奖励定义为每次行程的有效行驶距离,以激励更高的效率和更少的拥堵。
- 训练深度 Q 网络(DQN)代理,学习在每个决策点选择是否接受拼车请求的策略,以最大化长期累积奖励。
- 在 DQN 训练中使用小批量经验回放和目标网络,以稳定学习并提高收敛性。
- 将 DQN 策略与固定策略(始终接受)和表格 Q 学习策略进行对比,评估其在曼哈顿不同需求模式下的性能表现。
实验结果
研究问题
- RQ1在不依赖地图或路线信息的前提下,基于原始 GPS 数据训练的深度学习模型能否准确预测行程时间和距离?
- RQ2与固定策略相比,基于模拟出租车行程数据训练的强化学习代理是否能在有效行程距离和减少拥堵方面学习到更优的拼车策略?
- RQ3在不同出租车需求密度区域(如曼哈顿上城与下城)中,RL 策略的性能表现有何差异?
- RQ4与现有最先进的行程时间估计方法相比,ST-NN 模型在预测准确性和对异常值的鲁棒性方面提升了多少?
- RQ5RL 代理能否通过战略性地向高价值区域移动,实现以牺牲短期收益为代价换取长期收益的权衡,特别是在低需求区域?
主要发现
- 在曼哈顿上城,DQN 学习到的策略优于固定策略和表格 Q 策略,工作日平均累积奖励达到 46.08,周末为 27.86,而固定策略分别为 41.543 和 25.39。
- 在曼哈顿下城,由于出租车需求较高,DQN 策略与固定策略表现几乎相同(工作日分别为 339.42 和 340.06),表明在高密度区域始终接受拼车已接近最优。
- ST-NN 模型在预测准确性和对异常值的鲁棒性方面显著优于现有最先进的行程时间估计方法,且无需人工特征工程。
- DQN 代理学会了有选择性地接受拼车请求,尤其在低需求区域(如曼哈顿上城),通过优先向长期 Q 值更高的区域移动,即使牺牲即时奖励。
- 表格 Q 策略表现最差,因其在庞大的状态-动作空间中难以维持 Q 值,导致测试时 Q 值表稀疏且频繁出现零值预测。
- 在曼哈顿上城,DQN 策略在下午开始与固定策略产生分歧,通过战略性地延迟即时接单,以进入未来价值更高的状态,展现出智能的长期规划能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。