Skip to main content
QUICK REVIEW

[论文解读] (Blue) Taxi Destination and Trip Time Prediction from Partial Trajectories

Hoang Thanh Lam, Ernesto Diaz-Aviles|arXiv (Cornell University)|Sep 17, 2015
Human Mobility and Location-Based AnalysisSocial Sciences参考文献 8被引用 16
一句话总结

本文提出了一种数据驱动方法,通过行程匹配与集成学习,从部分GPS轨迹中预测出租车目的地和行程时间。通过利用历史行程模式并聚合多个模型的预测结果,该方法在ECML/PKDD 2015挑战赛中,行程时间预测任务获得第3名,目的地预测任务获得第7名,展现出在不同测试集上高度稳健且一致的性能。

ABSTRACT

Real-time estimation of destination and travel time for taxis is of great importance for existing electronic dispatch systems. We present an approach based on trip matching and ensemble learning, in which we leverage the patterns observed in a dataset of roughly 1.7 million taxi journeys to predict the corresponding final destination and travel time for ongoing taxi trips, as a solution for the ECML/PKDD Discovery Challenge 2015 competition. The results of our empirical evaluation show that our approach is effective and very robust, which led our team -- BlueTaxi -- to the 3rd and 7th position of the final rankings for the trip time and destination prediction tasks, respectively. Given the fact that the final rankings were computed using a very small test set (with only 320 trips) we believe that our approach is one of the most robust solutions for the challenge based on the consistency of our good results across the test sets.

研究动机与目标

  • 通过使用不完整的GPS轨迹实时预测最终目的地和行程时长,提升电子出租车调度效率。
  • 解决城市交通系统中出租车司机报告目的地不准确或缺失的问题。
  • 开发一种稳健的、数据驱动的实时预测解决方案,确保在不同交通和轨迹条件下均表现一致。
  • 在ECML/PKDD 2015发现挑战赛中,于目的地预测与行程时间预测两项任务上均超越现有方法。
  • 在葡萄牙波尔图市170万条出租车行程的大规模数据集上,验证行程匹配与集成学习的有效性。

提出的方法

  • 该方法使用行程匹配技术,识别历史中与当前测试行程具有相似部分轨迹的出租车行程。
  • 从匹配的历史行程中提取特征,包括目的地和行程时间,作为预测模型的训练信号。
  • 基于匹配的特征训练随机森林与极化随机树模型,并对超参数进行调优以实现最佳性能。
  • 通过平均法与正则化线性回归(L1与L2正则化)构建多个模型集成,以融合预测结果并提升鲁棒性。
  • 对训练数据进行筛选,仅保留包含2至612个GPS更新点的行程,以匹配测试集中观察到的分布。
  • 最终预测通过集成平均或元回归生成,模型选择依据公开排行榜反馈进行。

实验结果

研究问题

  • RQ1是否可以可靠地利用具有相似部分轨迹的历史行程模式,来预测正在进行中的出租车行程的最终目的地?
  • RQ2集成学习在结合多个基于匹配历史行程训练的模型预测结果方面,对行程时间和目的地预测的效率如何?
  • RQ3模型在不同测试集上的鲁棒性与一致性程度,与真实世界预测挑战赛中的最终排名在多大程度上相关?
  • RQ4不同的集成策略——平均法、L1正则化与L2正则化——对未见测试数据的预测性能有何影响?
  • RQ5在仅使用有限GPS更新点(2–612个点)的行程子集上训练的模型,是否能很好地泛化到完整测试集?

主要发现

  • 采用四种模型类型平均集成的模型集合ME5在公开排行榜上取得最佳成绩,RMSLE = 0.49408,行程时间预测任务中位列第3名。
  • 采用L1正则化线性回归(Lasso)的集成模型在公开与私有测试集上的平均表现最佳,RMSLE = 0.51173。
  • 采用L2正则化的模型集合ME2在私有排行榜上取得RMSLE = 0.51327——若被选中,将位列第1名,但因公开排行榜反馈未被采纳。
  • 该方法展现出高度鲁棒性,其在公开与私有测试集上均表现一致,表明具有强大的泛化能力。
  • 在目的地预测任务中获得第7名,证实该方法在两项预测目标上均具有效能。
  • 预处理步骤有效处理了缺失的GPS点与错误的时间戳,提升了模型的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。