Skip to main content
QUICK REVIEW

[论文解读] Location Estimation Using Crowdsourced Geospatial Narratives

Γεώργιος Σκούμας, Dieter Pfoser|arXiv (Cornell University)|Aug 25, 2014
Geographic Information Systems Studies参考文献 28被引用 4
一句话总结

本文提出了一种概率框架,通过使用包含定性空间关系(例如‘邻近’、‘在……旁边’)的众包文本叙述来估计未知物体的位置。通过自然语言处理提取地名和空间关系,利用距离和方向特征进行量化,并采用基于贪心期望最大化(EM)算法的高斯混合模型对不确定性进行建模,该方法通过三角测量实现精确的位置估计——即使在数据有限的情况下也能达到亚2公里的精度。

ABSTRACT

The "crowd" has become a very important geospatial data provider. Subsumed under the term Volunteered Geographic Information (VGI), non-expert users have been providing a wealth of quantitative geospatial data online. With spatial reasoning being a basic form of human cognition, narratives expressing geospatial experiences, e.g., travel blogs, would provide an even bigger source of geospatial data. Textual narratives typically contain qualitative data in the form of objects and spatial relationships. The scope of this work is (i) to extract these relationships from user-generated texts, (ii) to quantify them and (iii) to reason about object locations based only on this qualitative data. We use information extraction methods to identify toponyms and spatial relationships and to formulate a quantitative approach based on distance and orientation features to represent the latter. Positional probability distributions for spatial relationships are determined by means of a greedy Expectation Maximization-based (EM) algorithm. These estimates are then used to "triangulate" the positions of unknown object locations. Experiments using a text corpus harvested from travel blog sites establish the considerable location estimation accuracy of the proposed approach.

研究动机与目标

  • 从用户生成的旅行叙述中提取定性空间关系(例如‘附近’、‘在……旁边’)和地名。
  • 利用距离和方向特征对这些定性空间关系进行量化。
  • 通过贪心期望最大化(EM)算法,使用概率密度函数(PDF)对这些关系中的不确定性进行建模。
  • 通过将多个空间关系与已知兴趣点(POI)进行三角测量,推断未知点位的不确定性位置。
  • 在真实世界的旅行博客语料库上验证该方法,证明其在存在噪声和主观性用户输入的情况下仍具备鲁棒性和准确性。

提出的方法

  • 使用自然语言处理技术识别旅行博客文本中的地名(地标)和空间关系短语(例如‘在……旁边’、‘附近’)。
  • 将每个空间关系转换为包含未知POI与已知POI之间相对距离和角度方向的空间特征向量。
  • 使用贪心期望最大化(EM)算法训练高斯混合模型(GMM),以学习每类关系的空间特征的概率密度函数(PDF)。
  • 利用学习到的PDF,基于多个观测结果生成未知POI的位置概率分布。
  • 通过结合来自不同空间关系的多个概率估计进行三角测量,以优化未知POI的位置。
  • 采用贪心EM方法优化GMM,以处理不确定性,并在噪声较大的众包数据上提升模型收敛性。

实验结果

研究问题

  • RQ1能否从众包旅行叙述中可靠地提取并量化定性空间关系,以支持地理空间推理?
  • RQ2仅基于与已知地标之间的定性空间关系,未知POI位置的估计精度如何?
  • RQ3增加空间关系观测数量在多大程度上能提升位置估计的准确性?
  • RQ4所提出的概率模型在应对人类指定空间关系中固有的不确定性和变异性方面有多强的鲁棒性?
  • RQ5该方法能否有效处理来自真实世界旅行博客的噪声大、异构性强的文本叙述,并生成精确的位置估计?

主要发现

  • 当使用100%的空间关系时,该方法在北京的平均估计误差仅为1.2公里,在巴黎为0.8公里,显示出极高的精度。
  • 即使仅使用10%的关系,平均误差仍保持在15公里以内,表明在数据极少的情况下性能依然出色。
  • 在伦敦和纽约,尽管关系数量较少,该方法仍实现了合理的精度:误差分别从15.3公里降至7.7公里,从16.2公里降至11.1公里,随着数据量增加而持续改善。
  • 所有城市中的精度提升趋势一致,证实更多观测数据可带来更精确的位置估计。
  • 基于贪心EM的GMM方法能有效建模定性空间数据中的不确定性,从而实现可靠的概率位置推断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。