Skip to main content
QUICK REVIEW

[論文レビュー] Web scraping: a promising tool for geographic data acquisition

Alexander Brenning, Sebastian Henn|arXiv (Cornell University)|May 31, 2023
Geographic Information Systems Studies被引用数 7
ひとこと要約

本稿は、特に家賃動向やグレーティフィケーションといった都市的ダイナミクスの文脈において、コスト効率が良く、リアルタイムな地理的データ取得のためのウェブスクリーニングの有効性を主張している。ランダムフォレストとGAMモデルを用いたライプツィヒの賃貸住宅家賃に関する研究において、予測誤差が低く(RMSE: 1.08 €/m²)実証されたが、地理的情報のウェブデータに特有の倫理的・法的・手法論的課題にも言及している。

ABSTRACT

With much of our lives taking place online, researchers are increasingly turning to information from the World Wide Web to gain insights into geographic patterns and processes. Web scraping as an online data acquisition technique allows us to gather intelligence especially on social and economic actions for which the Web serves as a platform. Specific opportunities relate to near-real-time access to object-level geolocated data, which can be captured in a cost-effective way. The studied geographic phenomena include, but are not limited to, the rental market and associated processes such as gentrification, entrepreneurial ecosystems, or spatial planning processes. Since the information retrieved from the Web is not made available for that purpose, Web scraping faces several unique challenges, several of which relate to location. Ethical and legal issues mainly relate to intellectual property rights, informed consent and (geo-) privacy, and website integrity and contract. These issues also effect the practice of open science. In addition, there are technical and statistical challenges that relate to dependability and incompleteness, data inconsistencies and bias, as well as the limited historical coverage. Geospatial analyses furthermore usually require the automated extraction and subsequent resolution of toponyms or addresses (geoparsing, geocoding). A study on apartment rent in Leipzig, Germany is used to illustrate the use of Web scraping and its challenges. We conclude that geographic researchers should embrace Web scraping as a powerful and affordable digital fieldwork tool while paying special attention to its legal, ethical, and methodological challenges.

研究の動機と目的

  • 近接リアルタイムの地理的データを取得するための、実用的で費用対効果の高い手法としてウェブスクリーニングを確立すること、特に社会経済的および都市的プロセスに焦点を当てる。
  • 地理的調査におけるウェブスクリーニングに特有の、法的・倫理的・手法論的課題(特に地理的情報、プライバシー、データ整合性)を解決すること。
  • 地理学的応用におけるウェブスクリーニングの実践的ワークフローを示すこと。これには、ジオパーサー、ジオコーディング、およびデータの拡張が含まれる。
  • 地理的情報科学分野における学術的および教育的応用において、責任ある、オープンサイエンスに準拠したウェブスクリーニングの実践を促進すること。

提案手法

  • ウェブスクリーニングを用いて、明示的または暗黙的な位置情報を持つ物件の位置指定データを、不動産プラットフォームから抽出する。
  • 固有名詞処理とアドレス解決(ジオパーサーとジオコーディング)を適用し、テキストによる位置情報参照を空間座標に変換する。
  • ランダムフォレストと一般化加法モデル(GAM)を用いて、面積、築年数、設備、交通機関への近接性などの特徴量に基づき、賃貸住宅の家賃を予測する。
  • GAMにおける縮小(shrinkage)による変数選択と、ランダムフォレストにおける特徴量の重要度評価を用いて、予測変数の関連性を評価し、過学習を低減する。
  • トレーニングに使用しなかった5,245件のアパートメントを含むホールドアウトテストセットを用いて、モデルの性能を評価する。
  • 標準化されたアパートメント条件のもとで、ライプツィヒ全域の家賃予測を可視化するための空間的予測マップを生成する。

実験結果

リサーチクエスチョン

  • RQ1ウェブスクリーニングは、グレーティフィケーションや住宅市場といった都市的プロセスの地理的研究において、どのように近接リアルタイムで位置指定されたデータを効果的に取得できるか?
  • RQ2地理的情報やプライバシーに敏感な情報を含むウェブスクリーニングにおいて、法的・倫理的・技術的課題の主なものは何か?
  • RQ3スクリーニングされたデータに基づく機械学習モデルは、賃貸住宅家賃といった地理的現象をどれほど正確に予測できるか。また、異なるモデリング手法の比較はどの程度有効か?
  • RQ4ジオパーサーとジオコーディングは、非構造化テキストデータの空間的分析を可能にするウェブスクリーニングワークフローに、どのように統合できるか?

主な発見

  • ランダムフォレストモデルがテストセットで最小の予測誤差(RMSE: 1.08 €/m²)を達成し、縮小付きGAM(RMSE: 1.22 €/m²)および初期GAM(RMSE: 1.27 €/m²)を上回った。
  • RMSE値が類似しているにもかかわらず、ランダムフォレストとGAMモデルの予測マップには顕著な差が見られ、滑らかな関係と段階的関係のモデル特性の違いがその理由である可能性がある。
  • ウェブスクリーニングにより、社会経済的プロセスのリアルタイムなデータ取得が可能となり、頻度が低い国勢調査やアンケート調査とは対照的に、タイムリーな代替手段を提供する。
  • 非構造化テキストによる位置情報参照を分析可能な地理的情報に変換するには、ジオパーサーとジオコーディングによる地理的情報の拡張が不可欠である。
  • 本研究は、公式データソースが制限されているか高価な場合に、ウェブスクリーニングがデータへのアクセスを民主化できることを実証している。
  • プライバシー、知的財産権、およびウェブサイトの利用規約といった倫理的・法的制約は、データが公開されている場合でも、依然として重要な障壁のままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。