Skip to main content
QUICK REVIEW

[논문 리뷰] An empirical study on the names of points of interest and their changes with geographic distance

Yingjie Hu, Krzysztof Janowicz|arXiv (Cornell University)|2018. 06. 21.
Geographic Information Systems Studies참고 문헌 17인용 수 6
한 줄 요약

이 연구는 미국 일곱 개 도시권에서 112,071개의 관심지점(POI)을 야후 데이터를 사용해 분석하여, POI 이름 용어가 지리적 거리와 어떻게 변하는지 분석한다. TF-IDF와 word2vec을 적용해 현지 용어를 식별하고 의미 유사도를 측정한 결과, 이름 유사도에 강한 거리 감쇠 효과가 나타나며 기울기가 -0.090이고 결정계수 R-squared가 0.828임을 확인하여, 지리적 거리가 증가할수록 POI 이름의 유사도가 감소하는 것으로 나타났다.

ABSTRACT

While Points Of Interest (POIs), such as restaurants, hotels, and barber shops, are part of urban areas irrespective of their specific locations, the names of these POIs often reveal valuable information related to local culture, landmarks, influential families, figures, events, and so on. Place names have long been studied by geographers, e.g., to understand their origins and relations to family names. However, there is a lack of large-scale empirical studies that examine the localness of place names and their changes with geographic distance. In addition to enhancing our understanding of the coherence of geographic regions, such empirical studies are also significant for geographic information retrieval where they can inform computational models and improve the accuracy of place name disambiguation. In this work, we conduct an empirical study based on 112,071 POIs in seven US metropolitan areas extracted from an open Yelp dataset. We propose to adopt term frequency and inverse document frequency in geographic contexts to identify local terms used in POI names and to analyze their usages across different POI types. Our results show an uneven usage of local terms across POI types, which is highly consistent among different geographic regions. We also examine the decaying effect of POI name similarity with the increase of distance among POIs. While our analysis focuses on urban POI names, the presented methods can be generalized to other place types as well, such as mountain peaks and streets.

연구 동기 및 목표

  • POI 이름 용어가 지역 문화를 어떻게 반영하고 지리 공간에 따라 어떻게 변하는지 이해하기 위해.
  • 지리적 TF-IDF를 사용해 POI 이름의 현지 용어를 식별하고, 다양한 POI 유형 간 사용 정도를 평가하기 위해.
  • 지역 간 POI 이름의 집합적 의미 유사도를 모델링하고 거리 감쇠 효과가 존재하는지 검증하기 위해.
  • 지리 정보 검색 및 장소 이름 해석에 있어 정량적 기반을 제공하기 위해.

제안 방법

  • 미국 일곱 개 도시권에 걸쳐 개방형 야후 데이터셋에서 112,071개의 POI를 추출하였다.
  • 지리적 맥락에서 어휘 빈도-역문헌 빈도(TF-IDF)를 적용해 POI 이름 내 현지 용어를 식별하였다.
  • word2vec 임베딩을 사용해 지역 간 POI 이름 간 의미 유사도를 모델링하였다.
  • 카운트 기반 벡터와 word2vec 임베딩을 모두 사용해 도시권 간 집합적 유사도 행렬을 계산하였다.
  • 지리적 거리 증가에 따라 이름 유사도가 감소하는 경향을 분석하기 위해 선형 모델을 피팅하였다.
  • 유사도 패턴을 지리적 거리 행렬과 대비시켜 시각화를 통해 결과를 검증하였다.

실험 결과

연구 질문

  • RQ1POI 유형에 따라 현지 용어의 사용 방식은 어떻게 다를지, 이 패턴은 지리적 지역 간 일관성 있는가?
  • RQ2도시권 간 지리적 거리가 증가할수록 POI 이름 유사도는 어느 정도 감소하는가?
  • RQ3카운트 기반 벡터 표현과 word2vec 임베딩은 POI 이름의 의미 유사도를 얼마나 잘 반영하는가?
  • RQ4지리적 거리와 지역 간 POI 이름의 집합적 유사도 간 정량적 관계는 어떠한가?
  • RQ5관찰된 현지 용어 사용 패턴과 이름 유사도 패턴은 장소 이름 해석을 위한 계산 모델에 어떻게 기여할 수 있는가?

주요 결과

  • POI 이름의 현지 용어는 빈도 분포에서 지프의 법칙을 따르며, 용어 사용에 강력한 힘의 법칙 패턴을 보인다.
  • 현지 용어 사용은 POI 유형 간 균형 잡히지 않게 이루어지며, 자동차 수리 서비스에서 레스토랑보다 더 높은 현지 용어 사용 비율을 보인다.
  • POI 이름 유사도에 강력한 거리 감쇠 효과가 관찰되었으며, word2vec 임베딩을 사용할 경우 기울기가 -0.090이고 결정계수 R-squared가 0.828이다.
  • 카운트 기반 벡터보다 word2vec 기반의 유사도 측정 방식이 지리적 거리 패턴과 더 밀접한 일치를 보였다.
  • 유사도 패턴은 지리적으로 가까운 도시권 쌍과 먼 도시권 쌍에 해당하는 두 개의 명확한 군집을 드러냈다.
  • 결과는 POI 이름의 의미가 체계적으로 지리적 접근성에 영향을 받으며, 지리정보시스템에서 현지 언어적 특징을 활용할 것을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.