Skip to main content
QUICK REVIEW

[論文レビュー] IP Geolocation through Reverse DNS

Ovidiu Dan, Vaibhav Parikh|arXiv (Cornell University)|Nov 10, 2018
Internet Traffic Analysis and Secure E-voting参考文献 30被引用数 5
ひとこと要約

本稿では、公開済みの逆方向DNSホストネームを用いてIPアドレスの位置特定を行う機械学習的手法を提案し、多ラベル分類問題として扱い、都市レベルの潜在的場所をランク付けする。本手法は学術的ベースラインを著しく上回り、商用の位置特定データベースと補完的であり、真の位置から20 km以内に収まるホストネームの割合が54%に達する。

ABSTRACT

IP Geolocation databases are widely used in online services to map end user IP addresses to their geographical locations. However, they use proprietary geolocation methods and in some cases they have poor accuracy. We propose a systematic approach to use publicly accessible reverse DNS hostnames for geolocating IP addresses. Our method is designed to be combined with other geolocation data sources. We cast the task as a machine learning problem where for a given hostname, we generate and rank a list of potential location candidates. We evaluate our approach against three state of the art academic baselines and two state of the art commercial IP geolocation databases. We show that our work significantly outperforms the academic baselines, and is complementary and competitive with commercial databases. To aid reproducibility, we open source our entire approach.

研究の動機と目的

  • 商用技術とは対照的にあまり注目されていない逆方向DNSホストネームを活用した、体系的かつ公開可能なIP位置特定手法の開発。
  • 学術的ベースラインの限界を克服するため、機械学習を用いて公開可能なホストネームデータを活用すること。
  • 商用データベースが不足する分野においても、逆方向DNSデータと他の情報源を統合することで、IP位置特定システムの精度とカバレッジを向上させること。
  • 正確なGPSデータの収集を避けて、公開された粗い位置情報のヒントのみに依存することで、プライバシーを保護すること。
  • 全パイプライン(特徴量生成器、分類器、サンプリング戦略を含む)をオープンソース化することで、再現可能性を確保すること。

提案手法

  • 逆方向DNSによる位置特定を、各ホストネームが都市レベルの潜在的場所のランク付きリストにマッピングされる多ラベル分類問題として扱う。
  • ホストネームスプリッターがサブコンponent(例:'wallingford.ct.us')を都市、州、国などの地理的用語に分解する。
  • ノイズを低減するため、非地理的用語(例:'mail'、'server')をフィルタリングするブラックリストを適用する。
  • 地理的用語の頻度、言語的パターン、ホストネーム構造からの文脈的手がかりを含む、主特徴量と補助特徴量の組み合わせを用いる。
  • 2700万件のホストネームと匿名化された都市レベルの位置情報を含むグランドトゥースデータセットを用いて、特徴量工学に公開データセットを活用し、教師あり分類器を学習する。
  • モデルは各ホストネームに対して複数の妥当な場所候補を出力するため、他の位置特定データソースと統合することで全体の精度を向上させることができる。

実験結果

リサーチクエスチョン

  • RQ1商用データベースが不正確または不完全な場合に、逆方向DNSホストネームを体系的に活用することでIP位置特定の精度を向上させられるか?
  • RQ2逆方向DNSデータで学習した機械学習モデルは、最先端の学術的ベースラインと比較して、誤差距離とカバレッジの点でどの程度優れているか?
  • RQ3逆方向DNS位置特定はどの程度商用位置特定データベースと補完的であり、どの分野でそれらを上回るか?
  • RQ4位置特定システムの信頼性と倫理的利用に与える影響として、匿名化されたグランドトゥース(都市レベルの精度)を用いたプライバシー保護型データ取り扱いの効果は何か?
  • RQ5公開可能なデータとサンプリング戦略のみを用いて、完全にオープンソースの逆方向DNS位置特定パイプラインを構築し、再現可能にすることができるか?

主な発見

  • 提案手法は、中央誤差と累積誤差距離の両面で、3つの学術的ベースラインをすべて上回り、真の位置から20 km以内に収まる割合が54%に達する。
  • DRoPベースラインは他の手法と比べて著しく性能が低く、逆方向DNS位置特定において構造的な特徴量エンジニアリングの重要性を浮き彫りにしている。
  • 平均して、中央誤差は43.7 kmであったが、これは商用プロバイダーの16.7 kmおよび11.1 kmと比較すると著しく高いが、特定の分野では依然として競争力がある。
  • 教育機関や政府ネットワークなどのニッチ分野において、本手法は特に優れた性能を示し、商用データベースがしばしば性能を発揮しない分野で顕著である。
  • 複数の妥当な場所候補を出力できるモデルの能力のおかげで、他の位置特定ソースと統合しやすくなり、全体のシステムの頑健性が向上する。
  • モデル、特徴量生成器、サンプリング戦略のオープンソース化により、研究コミュニティによる完全な再現と拡張が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。