Skip to main content
QUICK REVIEW

[논문 리뷰] Web scraping: a promising tool for geographic data acquisition

Alexander Brenning, Sebastian Henn|arXiv (Cornell University)|2023. 05. 31.
Geographic Information Systems Studies인용 수 7
한 줄 요약

이 논문은 도시 역학, 예를 들어 임대료 추세와 고급화 현상과 같은 지리적 데이터 확보를 위한 웹 스크래핑 기법이 비용 효율적이고 실시간으로 활용될 수 있음을 주장한다. 레이프체른의 아파트 임대료 연구에 응용한 결과, 랜덤 포레스트 및 GAM 모델을 통해 낮은 예측 오차(RMSE: 1.08 €/m²)를 달성하였으며, 지리적 웹 데이터에 특화된 윤리적, 법적, 방법론적 과제를 제기하였다.

ABSTRACT

With much of our lives taking place online, researchers are increasingly turning to information from the World Wide Web to gain insights into geographic patterns and processes. Web scraping as an online data acquisition technique allows us to gather intelligence especially on social and economic actions for which the Web serves as a platform. Specific opportunities relate to near-real-time access to object-level geolocated data, which can be captured in a cost-effective way. The studied geographic phenomena include, but are not limited to, the rental market and associated processes such as gentrification, entrepreneurial ecosystems, or spatial planning processes. Since the information retrieved from the Web is not made available for that purpose, Web scraping faces several unique challenges, several of which relate to location. Ethical and legal issues mainly relate to intellectual property rights, informed consent and (geo-) privacy, and website integrity and contract. These issues also effect the practice of open science. In addition, there are technical and statistical challenges that relate to dependability and incompleteness, data inconsistencies and bias, as well as the limited historical coverage. Geospatial analyses furthermore usually require the automated extraction and subsequent resolution of toponyms or addresses (geoparsing, geocoding). A study on apartment rent in Leipzig, Germany is used to illustrate the use of Web scraping and its challenges. We conclude that geographic researchers should embrace Web scraping as a powerful and affordable digital fieldwork tool while paying special attention to its legal, ethical, and methodological challenges.

연구 동기 및 목표

  • 도시적, 사회경제적 과정에 특화된 근접 실시간 지리적 데이터 확보를 위한 웹 스크래핑 기법의 실현 가능성과 경제성을 입증하는 것.
  • 특히 지리공간 데이터, 개인정보, 데이터 무결성과 관련된 웹 스크래핑의 고유한 법적, 윤리적, 방법론적 과제를 다루는 것.
  • 지리학에서 웹 스크래핑의 실용적 워크플로우를 보여주며, 지오패싱, 지오코딩, 데이터 강화를 포함한 실제 사례를 제시하는 것.
  • 지역정보과학 분야의 학술 및 교육적 응용에 있어 책임감 있는, 오픈 사이언스 기준을 충족하는 웹 스크래핑 관행을 촉진하는 것.

제안 방법

  • 실제 부동산 플랫폼에서 개별 객체 수준의 지리적 위치 정보를 가진 데이터를 추출하기 위해 웹 스크래핑을 활용하며, 명시적 또는 암시적 위치 참조를 가진 아파트 목록에 집중한다.
  • 지명 및 주소 해석(지오패싱 및 지오코딩)을 적용하여 텍스트 기반 위치 참조를 공간 좌표로 변환한다.
  • 크기, 연식, 편의시설, 교통 접근성 등의 특징을 기반으로 아파트 임대료를 예측하기 위해 랜덤 포레스트 및 일반화된 가산 모델(GAM)을 사용한다.
  • GAM의 수축을 통한 변수 선택과 랜덤 포레스트의 특징 중요도 분석을 통해 예측 변수의 관련성 평가 및 과적합 방지를 도모한다.
  • 학습에 사용되지 않은 5,245개 아파트로 구성된 테스트 세트를 활용하여 모델 성능을 평가한다.
  • 표준화된 아파트 조건 하에 레이프체른 전역의 임대료 예측을 시각화하기 위해 공간 예측 지ap을 생성한다.

실험 결과

연구 질문

  • RQ1어떻게 웹 스크래핑을 활용하여 고급화나 주거 시장과 같은 도시 과정에 대한 근접 실시간 지리적 위치 정보를 효과적으로 확보할 수 있는가?
  • RQ2지리공간 데이터와 개인정보 민감 정보를 포함한 웹 스크래핑 과정에서 발생하는 주요 법적, 윤리적, 기술적 과제는 무엇인가?
  • RQ3스크래핑된 데이터 기반의 기계학습 모델이 아파트 임대료와 같은 지리현상을 얼마나 정확하게 예측할 수 있으며, 다양한 모델링 접근 방식 간의 성능은 어떻게 비교되는가?
  • RQ4지오패싱과 지오코딩은 어떻게 웹 스크래핑 워크플로우에 통합되어 비정형 텍스트 기반 위치 정보의 공간 분석을 가능하게 하는가?

주요 결과

  • 랜덤 포레스트 모델이 테스트 세트에서 가장 낮은 예측 오차(RMSE: 1.08 €/m²)를 기록하여, 수축 기반 GAM(RMSE: 1.22 €/m²)과 초기 GAM(RMSE: 1.27 €/m²)을 모두 앞섰다.
  • 비슷한 RMSE 값을 기록했음에도 불구하고, 랜덤 포레스트와 GAM 모델의 예측 지도 간에 뚜렷한 차이가 있었으며, 이는 부드러운 관계와 단계적 관계를 각각 반영하는 모델링 능력의 차이 때문일 가능성이 높다.
  • 웹 스크래핑은 사회경제적 과정에 대한 실시간 데이터 확보를 가능하게 하여, 드물게 실시되는 인구 조사나 설문 조사 자료에 비해 시기적절한 대안을 제공한다.
  • 지오패싱과 지오코딩을 통한 지리공간 데이터 강화는 비정형 텍스트 기반 위치 참조를 분석 가능한 지리정보로 전환하는 데 필수적이다.
  • 이 연구는 공식 자료원이 제한되거나 비용이 많이 들 경우, 웹 스크래핑이 데이터 접근성을 민주화할 수 있음을 입증한다.
  • 개인정보, 지적 재산권, 웹사이트 이용 약관과 같은 윤리적 및 법적 제약은 여전히 공개된 데이터일지라도 주요 장벽으로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.