Skip to main content
QUICK REVIEW

[论文解读] Stay-point Identification as Curve Extrema

Georgios Stylianou|arXiv (Cornell University)|Jan 23, 2017
Human Mobility and Location-Based Analysis参考文献 16被引用 4
一句话总结

本文提出一种基于几何的停留点识别方法,通过将用户轨迹转换为二维离散曲线,并将停留点检测为一阶导数中的局部极小值,从而消除对实验调优的距离和时间阈值的依赖。该方法在多种轨迹数据集上实现了86–98%的准确率,表现出对噪声、非均匀密度和定位误差的强鲁棒性。

ABSTRACT

In a nutshell, stay-points are locations that a person has stopped for some amount of time. Previous work depends mainly on stay-point identification methods using experimentally fine tuned threshold values. These behave well on their experimental datasets but may exhibit reduced performance on other datasets. In this work, we demonstrate the potential of a geometry-based method for stay-point extraction. This is accomplished by transforming the user's trajectory path to a two-dimensional discrete time series curve that in turn transforms the stay-points to the local minima of the first derivative of this curve. To demonstrate the soundness of the proposed method, we evaluated it on raw, noisy trajectory data acquired over the period of 28 different days using four different techniques. The results demonstrate, among others, that given a good trajectory tracking technique, we can identify correctly 86% to 98% of the stay-points.

研究动机与目标

  • 解决现有停留点识别方法因依赖实验调优的距离和时间阈值而导致的泛化能力不足问题。
  • 降低对特定应用的阈值设定的依赖,从而提升在不同数据集上的性能表现。
  • 开发一种对轨迹数据稀疏性、非均匀点密度和噪声具有鲁棒性的方法。
  • 提供一种稳定且计算高效的解决方案,适用于基于几何极值检测的实时停留点检测。
  • 在多种轨迹跟踪技术(数据质量与密度各异)上验证该方法的有效性。

提出的方法

  • 将用户的日常轨迹转换为二维离散时间序列曲线,其中横轴表示时间,纵轴表示累积位移。
  • 计算该曲线的一阶导数,以建模速度随时间的变化,从而将停留点检测问题转化为极值提取任务。
  • 将停留点识别为一阶导数曲线中的局部极小值,对应于低速或零速的时段。
  • 应用置信度公式以区分真实停留点与静止点,减少误报。
  • 使用单一、定义良好的数值阈值进行极值检测,替代多个启发式阈值。
  • 实现线性时间处理,具备实时处理能力。

实验结果

研究问题

  • RQ1是否可以将停留点识别重新定义为几何极值检测问题,从而消除对手动调优阈值的依赖?
  • RQ2所提出的方法在具有不同密度、噪声水平和点均匀性的轨迹数据集中表现如何?
  • RQ3该方法在无需对距离和时间阈值进行实验调优的情况下,能在多大程度上保持高准确率?
  • RQ4置信度公式在区分真实停留点与静止点方面有何改善作用?
  • RQ5该方法能否在不同轨迹跟踪技术之间实现泛化,即使其数据质量存在差异?

主要发现

  • 所提出的方法在使用四种不同跟踪技术采集的28天原始、嘈杂轨迹数据中,实现了86–98%的停留点识别准确率。
  • 该方法对轨迹数据稀疏性和非均匀点密度具有鲁棒性,且在不同数据质量下表现稳定。
  • 置信度公式成功识别了所有静止点,并生成了极少的误报停留点。
  • 混合跟踪技术与SLS-100技术分别将实际停留时长高估了19%和13%,其中SLS-100因数据密度更高,标准差更低。
  • 若采用固定的5分钟时间阈值,混合技术将导致6倍以上的误报,SLS-100技术将导致2.5倍以上的误报,凸显了基于阈值方法的局限性。
  • 拐点(低置信度极值)的平均持续时间分别为9分钟(混合技术)和4分钟(SLS-100),表明5分钟阈值将显著增加误报数量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。