Skip to main content
QUICK REVIEW

[論文レビュー] Location Estimation Using Crowdsourced Geospatial Narratives

Γεώργιος Σκούμας, Dieter Pfoser|arXiv (Cornell University)|Aug 25, 2014
Geographic Information Systems Studies参考文献 28被引用数 4
ひとこと要約

本稿では、定性的な空間的関係(例:'隣に'、'近くに')を含むクラウドソーシングされたテキスト的ナラティブから未知のオブジェクトの位置を推定する確率的フレームワークを提案する。自然言語処理を用いてトピノイムと空間的関係を抽出し、距離および方位の特徴量を用いて定量化し、グリーディEMベースのガウス・ミクスチャ・モデルを用いてその不確実性をモデル化することで、正確な位置推定を三角測量的に実現する。限られたデータでも2 km未満の精度を達成する。

ABSTRACT

The "crowd" has become a very important geospatial data provider. Subsumed under the term Volunteered Geographic Information (VGI), non-expert users have been providing a wealth of quantitative geospatial data online. With spatial reasoning being a basic form of human cognition, narratives expressing geospatial experiences, e.g., travel blogs, would provide an even bigger source of geospatial data. Textual narratives typically contain qualitative data in the form of objects and spatial relationships. The scope of this work is (i) to extract these relationships from user-generated texts, (ii) to quantify them and (iii) to reason about object locations based only on this qualitative data. We use information extraction methods to identify toponyms and spatial relationships and to formulate a quantitative approach based on distance and orientation features to represent the latter. Positional probability distributions for spatial relationships are determined by means of a greedy Expectation Maximization-based (EM) algorithm. These estimates are then used to "triangulate" the positions of unknown object locations. Experiments using a text corpus harvested from travel blog sites establish the considerable location estimation accuracy of the proposed approach.

研究の動機と目的

  • ユーザー生成の旅行ナラティブから定性的な空間的関係(例:'近くに'、'隣に')とトピノイムを抽出すること。
  • 距離および方位の特徴量を用いて、これらの定性的な空間的関係を定量化すること。
  • グリーディ期待値最大化(EM)アルゴリズムを用いて、確率密度関数(PDF)によりこれらの関係の不確実性をモデル化すること。
  • 既知のPOI(ポイント・オブ・インタレスト)に対する複数の空間的関係を三角測量的に組み合わせることで、未知のPOIの確率的位置を推定すること。
  • 実世界の旅行ブログコーパスを用いて本手法を検証し、主観的でノイズの多いユーザー入力にもかかわらず、その頑健性と精度を示すこと。

提案手法

  • 自然言語処理(NLP)技術を用いて、旅行ブログのテキストからトピノイム(ランドマーク)および空間的関係フレーズ(例:'隣に'、'近くに')を特定する。
  • 各空間的関係を、未知のPOIと既知のPOIの間の相対的距離および方位からなる空間的特徴量ベクトルに変換する。
  • 期待値最大化(EM)アルゴリズムを用いて、各関係タイプの空間的特徴量の確率密度関数(PDF)を学習するためのガウス・ミクスチャ・モデル(GMM)を訓練する。
  • 学習されたPDFを用いて、複数の観測に基づき未知POIの位置の確率的分布を生成する。
  • 複数の異なる空間的関係からの確率的推定値を組み合わせることで、未知POIの位置を精緻化する三角測量を適用する。
  • ノイズが多く、クラウドソーシングされたデータであるにもかかわらず、収束性を向上させるために、グリーディEMアプローチを用いてGMMを最適化する。

実験結果

リサーチクエスチョン

  • RQ1クラウドソーシングされた旅行ナラティブに含まれる定性的な空間的関係を、地理的推論に適した形で信頼性高く抽出・定量化できるか?
  • RQ2既知のランドマークに対する定性的な空間的関係のみを用いて、未知のPOIの位置をどの程度正確に推定できるか?
  • RQ3空間的関係の観測数を増やすことで、位置推定の精度がどの程度向上するか?
  • RQ4人間が指定する空間的関係に内在する不確実性とばらつきに対して、提案された確率的モデルはどの程度頑健か?
  • RQ5本手法は、現実世界のノイズが多く、多様なテキスト的ナラティブを含む旅行ブログのテキストを効果的に処理し、正確な位置推定を可能にするか?

主な発見

  • 100%の空間的関係を使用した場合、北京では平均推定誤差が1.2 km、パリでは0.8 kmにまで低下し、高い精度を示した。
  • 10%の関係しか使用しなくても、平均誤差は15 km未満に保たれ、最小限のデータでも優れた性能を示した。
  • ロンドンとニューヨークでは、関係の数が少ないにもかかわらず、データ量が増えるにつれて誤差は15.3 kmから7.7 km、16.2 kmから11.1 kmにまで低下し、妥当な精度を達成した。
  • すべての都市において精度の向上が一貫しており、観測数の増加がより正確な位置推定に寄与することを確認した。
  • グリーディEMベースのGMMアプローチは、定性的な空間的データの不確実性を効果的にモデル化し、信頼性の高い確率的位置推定を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。