Skip to main content
QUICK REVIEW

[论文解读] A Simple Baseline for Travel Time Estimation using Large-Scale Trip Data

Hongjian Wang, Zhenhui Li|arXiv (Cornell University)|Dec 28, 2015
Data Management and Algorithms参考文献 13被引用 22
一句话总结

本文提出了一种基于邻近的简单基线方法,用于利用大规模出租车行程数据进行行程时间估计,其中行程时间通过平均具有相似起讫点对和时间条件的历史行程来预测。该方法优于最先进的方法,包括Bing Maps和百度地图,实现了更低的平均绝对误差(MAE),并在纽约市和上海的真实数据集上表现出更优的准确性和效率。

ABSTRACT

The increased availability of large-scale trajectory data around the world provides rich information for the study of urban dynamics. For example, New York City Taxi Limousine Commission regularly releases source-destination information about trips in the taxis they regulate. Taxi data provide information about traffic patterns, and thus enable the study of urban flow -- what will traffic between two locations look like at a certain date and time in the future? Existing big data methods try to outdo each other in terms of complexity and algorithmic sophistication. In the spirit of "big data beats algorithms", we present a very simple baseline which outperforms state-of-the-art approaches, including Bing Maps and Baidu Maps (whose APIs permit large scale experimentation). Such a travel time estimation baseline has several important uses, such as navigation (fast travel time estimates can serve as approximate heuristics for A search variants for path finding) and trip planning (which uses operating hours for popular destinations along with travel time estimates to create an itinerary).

研究动机与目标

  • 解决利用大规模轨迹数据在城市环境中实现准确且高效的行程时间估计的挑战。
  • 提出一种简单的基线方法,使其在行程时间预测中优于复杂且算法精巧的方法。
  • 通过在邻近框架中引入时间粒度和空间动态,提升估计精度。
  • 通过过滤机制减轻轨迹数据中异常值的影响,以增强可靠性。
  • 证明在真实世界的行程时间预测中,数据驱动的简洁性可超越算法复杂性。

提出的方法

  • 该方法检索所有与查询行程具有相似起讫点位置的历史行程,形成用于估计的‘邻近’集合。
  • 行程时间通过邻近行程的行程时间均值得到估计,时间与空间接近度用于加权或筛选邻近行程。
  • 该方法使用绝对和相对时间粒度(例如一天中的小时、星期几)对行程进行分组,以提高估计精度。
  • 应用异常值过滤机制,以移除行程时间异常长的行程,从而提高鲁棒性并降低误差。
  • 该方法避免了路径重建,直接使用行程级别的数据,无需进行分段级路径推断。
  • 使用ARIMA模型基于邻近集合中的时间趋势对预测进行优化,以提升精度。

实验结果

研究问题

  • RQ1一个简单且数据驱动的基线方法是否能在行程时间估计中优于复杂且算法精巧的方法?
  • RQ2在邻近方法中引入时间与空间上下文在多大程度上能提升行程时间估计的准确性?
  • RQ3大规模行程数据中的异常值在多大程度上影响估计准确性?能否被有效过滤?
  • RQ4与Bing Maps和百度地图等商业服务相比,所提出方法在性能和效率上表现如何?
  • RQ5时间粒度对使用历史行程数据进行行程时间预测的准确性有何影响?

主要发现

  • 在纽约市数据集上,结合时间粒度的所提邻近方法(TEMP_abs + R)实现了最低的平均绝对误差(MAE)142.731秒,优于所有其他方法和商业服务。
  • 当从训练集中移除6.4%的异常值后,MAE降低了约5秒,表明数据质量对性能有显著影响。
  • 当训练集和测试集均包含异常值时,与干净训练设置相比,MAE增加了超过20秒,凸显了异常值过滤的重要性。
  • 该方法的在线查询时间在单线程下为每趟行程1.505毫秒,在八线程下为每趟行程0.26毫秒,显示出对实时应用的高效率。
  • 该方法在准确性和速度上均优于SUBPATH和商业地图服务(Bing Maps、百度地图),最准确的变体在纽约市数据上实现了142.731秒的MAE。
  • 结果证实了‘大数据胜过算法’——一种简单且以数据为中心的方法在真实世界的行程时间估计中可超越复杂模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。