Skip to main content
QUICK REVIEW

[論文レビュー] Location Reference Recognition from Texts: A Survey and Comparison

Xuke Hu, Zhiyong Zhou|Zurich Open Repository and Archive (University of Zurich)|Jul 4, 2022
Geographic Information Systems Studies被引用数 6
ひとこと要約

本稿は、26のデータセットにまたがる27の場所参照認識アプローチについて包括的なサーベイと比較評価を実施し、ルールベース、ガジェテアマッチング、統計的学習、ハイブリッドの4つのタイプに分類している。深層学習モデルが他の手法を上回り、アンサンブル投票システムは、特にツイートのような非公式なテキストにおいて、より高い耐性を示すことが判明した。

ABSTRACT

A vast amount of location information exists in unstructured texts, such as social media posts, news stories, scientific articles, web pages, travel blogs, and historical archives. Geoparsing refers to the process of recognizing location references from texts and identifying their geospatial representations. While geoparsing can benefit many domains, a summary of the specific applications is still missing. Further, there lacks a comprehensive review and comparison of existing approaches for location reference recognition, which is the first and a core step of geoparsing. To fill these research gaps, this review first summarizes seven typical application domains of geoparsing: geographic information retrieval, disaster management, disease surveillance, traffic management, spatial humanities, tourism management, and crime management. We then review existing approaches for location reference recognition by categorizing these approaches into four groups based on their underlying functional principle: rule-based, gazetteer matching-based, statistical learning-based, and hybrid approaches. Next, we thoroughly evaluate the correctness and computational efficiency of the 27 most widely used approaches for location reference recognition based on 26 public datasets with different types of texts (e.g., social media posts and news stories) containing 39,736 location references across the world. Results from this thorough evaluation can help inform future methodological developments for location reference recognition, and can help guide the selection of proper approaches based on application needs.

研究の動機と目的

  • 地理的パーサーの主な応用分野(災害管理、疾病監視、交通管理、空間的人文学など)を要約すること。
  • ルールベース、ガジェテアマッチングベース、統計的学習ベース、ハイブリッド手法の4つの機能的グループに分類して、既存の場所参照認識アプローチを体系的にレビューし分類すること。
  • 26の公開データセット(全39,736件のグローバルな場所参照を含む)において、27の広く使われている場所参照認識アプローチの正しさと計算効率を評価すること。
  • テキストタイプ(公式対非公式)、必要な場所の粒度、パフォーマンス制約といった、用途固有のニーズに基づいた最適な手法選定の根拠を提示すること。

提案手法

  • 著者らは、その根拠となる原理に基づき、27の既存の場所参照認識アプローチを4つの機能的グループに分類した:ルールベース、ガジェテアマッチングベース、統計的学習ベース、ハイブリッド手法。
  • 彼らは、ソーシャルメディア(例:ツイート)、ニュース記事、公式なウェブテキストを含む、多様なテキストタイプをカバーする26の公開データセット上で、各アプローチを評価した。
  • 評価指標には、全体の認識精度、公式対非公式テキストにおけるパフォーマンス、場所参照カテゴリ(例:都市、POI、道路)ごとの検出能力、計算効率が含まれた。
  • 比較フレームワークを用いて、異なるテキストタイプおよび場所の粒度において、精度と再現率の両方を評価し、結果をもとに特定の用途に最適な手法の順位付けと推奨を行う。
  • 複数のモデルを統合するためのボーリングメカニズムが用いられ、個々のアプローチよりも優れた耐性を示した。
  • 再現可能性と結果の広範な適用可能性を確保するため、GeoCorpora、NEEL2016、その他の公開データセットを分析に活用した。
Figure 1. The general workflow of geoparsing and its two steps.
Figure 1. The general workflow of geoparsing and its two steps.

実験結果

リサーチクエスチョン

  • RQ1公式なニュースと非公式なソーシャルメディア投稿の間で、場所参照認識アプローチのパフォーマンスに差は生じるか?
  • RQ2ルールベース、ガジェテアマッチング、統計的学習、ハイブリッドの4つの機能的グループのアプローチは、正確性と計算効率の観点でどのように比較できるか?
  • RQ3場所参照の粒度(例:国、都市、POI、道路)が、異なる手法における認識パフォーマンスに与える影響は何か?
  • RQ4複数のアプローチを統合するアンサンブル手法は、個々のモデルに比べて認識パフォーマンスと耐性を向上させることができるか?
  • RQ5短縮語、スラング、スペルミスといった非公式なテキスト特徴を処理する点で、現在のアプローチの主な制限は何であるか?

主な発見

  • 深層学習ベースのアプローチは、特に非公式なテキストに微調整を施した場合、場所参照認識において現在最も効果的である。
  • ボーリングメカニズムによる複数のアプローチの統合は、耐性と全体的なパフォーマンスを顕著に向上させ、個々のモデルを上回る。
  • テキストタイプによってパフォーマンスに顕著な差が生じる:公式なテキスト(例:ニュース)では高い性能を示すが、非公式なテキスト(例:ツイート)では、POI や道路のような細粒度の場所の検出精度が低くなる。
  • 計算効率は大きくばらつきを示しており、ルールベースおよびガジェテアベースの手法は深層学習モデルに比べて一般的に高速であるが、正確性の妥協を伴う。
  • リアルタイム処理が求められる災害管理や交通管理の文脈では、短い非公式なコンテンツに強く対応するGazPNE2が推奨される。
  • 大規模な公式テキストと粗粒度の場所を扱う空間的人文学、疾病監視、地理的情報検索の文脈では、Stanford NER、CogComp、spaCyが最適な選択である。これらは高い効率性と妥当な正確性を兼ね備えている。
Figure 2. Seven application domains of geoparsing.
Figure 2. Seven application domains of geoparsing.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。