[논문 리뷰] GeoTextTagger: High-Precision Location Tagging of Textual Documents using a Natural Language Processing Approach
GeoTextTagger는 품사 태깅, 명명된 실체 인식, 그리고 OpenStreetMap 데이터 기반의 거리 기반 스코어링 시스템을 결합하여 텍스트 문서의 지도 태깅을 위한 고정밀 자연어 처리 기법을 제안한다. 위키백과 기사에서 10번째 백분율 오차는 490미터, 중앙값 오차는 54킬로미터이며, 상위 다섯 스코어를 고려할 경우 50퍼센트의 기사가 참조된 진짜 위치에서 8.5킬로미터 이내로 정확하게 태깅된다.
Location tagging, also known as geotagging or geolocation, is the process of assigning geographical coordinates to input data. In this paper we present an algorithm for location tagging of textual documents. Our approach makes use of previous work in natural language processing by using a state-of-the-art part-of-speech tagger and named entity recognizer to find blocks of text which may refer to locations. A knowledge base (OpenStreatMap) is then used to find a list of possible locations for each block. Finally, one location is chosen for each block by assigning distance-based scores to each location and repeatedly selecting the location and block with the best score. We tested our geolocation algorithm with Wikipedia articles about topics with a well-defined geographical location that are geotagged by the articles' authors, where classification approaches have achieved median errors as low as 11 km, with attainable accuracy limited by the class size. Our approach achieved a 10th percentile error of 490 metres and median error of 54 kilometres on the Wikipedia dataset we used. When considering the five location tags with the greatest scores, 50% of articles were assigned at least one tag within 8.5 kilometres of the article's author-assigned true location. We also tested our approach on Twitter messages that are tagged with the location from which the message was sent. Twitter texts are challenging because they are short and unstructured and often do not contain words referring to the location they were sent from, but we obtain potentially useful results. We explain how we use the Spark framework for data analytics to collect and process our test data. In general, classification-based approaches for location tagging may be reaching their upper accuracy limit, but our precision-focused approach has high accuracy for some texts and shows significant potential for improvement overall.
연구 동기 및 목표
- 문서 내 텍스트 기반 참조에 정확한 지리적 좌표를 할당하는 고정밀 지도 태깅 시스템을 개발하는 것.
- 분류 기반 접근 방식의 한계를 극복하여 지도 태깅 정확도를 향상시키는 것. 이는 클래스 크기 제약과 정확도 향상의 감소 효과를 고려한 것이다.
- 문서당 다중 태깅을 가능하게 하여 텍스트 내에서 다수의 잠재적 위치 참조를 식별하고 스코어링하는 것.
- 정형화된 위키백과 기사와 비정형적인 트위터 메시지 모두에서 성능을 평가함으로써 실제 환경의 도전 과제를 반영하는 것.
- 확장 가능한 데이터 처리 및 지도 태깅 데이터셋 통합을 위해 Apache Spark를 활용하는 것.
제안 방법
- 최신 기술의 품사 태거와 명명된 실체 인식기로 텍스트 내 후보 위치 참조를 식별한다.
- 각 식별된 텍스트 블록에 대해 후보 위치를 검색하기 위해 OpenStreetMap을 지식 기반으로 활용한다.
- 진짜 위치와의 거리 기반 스코어를 할당하여 각 후보 위치에 대해 스코어링을 수행하며, 탐욕적 선택 전략을 사용한다.
- 반복적으로 각 텍스트 블록에 대해 가장 높은 스코어를 가진 위치를 선택함으로써 정밀도를 향상시키는 반복적 개선 전략을 적용한다.
- 위키백과 및 트위터 지도 태깅 데이터의 효율적 인gest, 조인, 전처리를 위해 대규모 데이터셋을 Apache Spark를 통해 처리한다.
- 특정 지역(캐나다, 미국, 네덜란드, 호주)에서 지도 태깅된 트위터 메시지를 수집하기 위해 Spark Streaming을 수정하여 관련 훈련 데이터 확보.
실험 결과
연구 질문
- RQ1정밀도 중심의 NLP 접근 방식이 기존 분류 기반 지도 태깅 방법보다 국지화 정확도 측면에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ2특히 텍스트에 다수의 지리적 참조가 포함된 경우, 시스템이 문서당 다수의 위치를 태깅하는 데 얼마나 효과적인가?
- RQ3일반적으로 명시적 위치 단서가 부족한 짧고 비정형적인 텍스트인 트위터 메시지에 대해 알고리즘이 어떤 성능을 보이는가?
- RQ4고정 클래스 분류 모델 대비 동적 거리 기반 스코어링 시스템이 정확도 향상에 얼마나 기여하는가?
- RQ5Apache Spark와 같은 확장 가능한 데이터 처리 프레임워크가 지도 태깅 연구를 위해 대규모 이질적인 지도 태깅 데이터셋의 인계 및 통합을 효과적으로 지원할 수 있는가?
주요 결과
- 가장 높은 스코어 태그만 고려할 경우, GeoTextTagger는 위키백과 데이터셋에서 10번째 백분율 오차가 490미터, 중앙값 오차가 54킬로미터를 기록했다.
- 문서당 상위 다섯 스코어 태그를 고려할 경우, 위키백과 기사의 50퍼센트가 저자 할당 진짜 위치에서 8.5킬로미터 이내에 정확한 태그를 가졌으며.
- 짧고 비정형적이며 오류가 많은 텍스트라는 도전 과제가 있음에도 불구하고, 시스템은 트위터 데이터에서 뛰어난 성능을 보였으며, 실세계 적용 잠재력이 있음을 시사한다.
- 기존 분류 기반 방법에 비해 알고리즘 성능이 뚜렷이 뛰어나며, 유사한 위키백과 데이터에서 기존 방법은 중앙값 오차 약 11킬로미터를 기록한 바 있어, 정밀도 중심 접근 방식의 전환을 시사한다.
- Apache Spark의 사용은 대규모 지도 태깅 데이터셋의 효율적 처리를 가능하게 하였으며, 위키백과 기사와 위치 태그를 조인하기 위해 스크립트가 80줄 이내로 작성되었다.
- 본 연구에서 사용된 데이터셋은 이전 연구와 다름을 보이며, 더 늦은 데이터 덤프(2015년 6월 대비 2010년 9월)를 사용했고, 최종 데이터셋에서 리디렉션 기사가 존재하지 않음은 처리 파이프라인 필터링의 영향일 가능성이 높다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.