Skip to main content
QUICK REVIEW

[论文解读] IP Geolocation through Reverse DNS

Ovidiu Dan, Vaibhav Parikh|arXiv (Cornell University)|Nov 10, 2018
Internet Traffic Analysis and Secure E-voting参考文献 30被引用 5
一句话总结

本文提出一种基于公开反向DNS主机名的机器学习方法,用于IP地址地理定位,将该任务视为多标签分类问题,以对潜在的城市级位置进行排序。该方法显著优于学术基线,并可与商业地理定位数据库互补,实现54%的主机名定位在真实位置20公里以内。

ABSTRACT

IP Geolocation databases are widely used in online services to map end user IP addresses to their geographical locations. However, they use proprietary geolocation methods and in some cases they have poor accuracy. We propose a systematic approach to use publicly accessible reverse DNS hostnames for geolocating IP addresses. Our method is designed to be combined with other geolocation data sources. We cast the task as a machine learning problem where for a given hostname, we generate and rank a list of potential location candidates. We evaluate our approach against three state of the art academic baselines and two state of the art commercial IP geolocation databases. We show that our work significantly outperforms the academic baselines, and is complementary and competitive with commercial databases. To aid reproducibility, we open source our entire approach.

研究动机与目标

  • 开发一种系统化、公开可访问的IP地理定位方法,利用反向DNS主机名,这些主机名通常因偏爱专有技术而被忽视。
  • 通过利用公开的主机名数据与机器学习技术,解决现有学术地理定位基线的局限性。
  • 通过结合反向DNS数据与其他数据源,特别是商业数据库覆盖不足的领域,提升IP地理定位系统的准确性和覆盖率。
  • 通过仅依赖主机名中公开共享的粗粒度位置提示(避免收集精确GPS数据),确保隐私保护。
  • 通过开源整个流程(包括特征生成器、分类器和采样策略),实现可复现性。

提出的方法

  • 该方法将反向DNS地理定位视为多标签分类问题,其中每个主机名被映射为潜在城市级位置的排序列表。
  • 主机名拆分器将子组件(例如 'wallingford.ct.us')解析为潜在地理术语,如城市、州和国家。
  • 黑名单用于过滤掉非地理术语(例如 'mail'、'server'),以减少特征空间中的噪声。
  • 该方法结合主要和次要特征,包括地理术语频率、语言模式以及主机名结构中的上下文线索。
  • 在包含2700万条主机名的真值数据集上训练监督分类器,该数据集包含匿名化的城市级位置信息,并使用公开数据集进行特征工程。
  • 模型为每个主机名输出多个可能的位置候选,从而可与其它地理定位数据源融合,以提高整体准确性。

实验结果

研究问题

  • RQ1是否可以系统性地利用反向DNS主机名提升IP地理定位的准确性,特别是在商业数据库不准确或不完整的情况下?
  • RQ2在误差距离和覆盖率方面,基于反向DNS数据训练的机器学习模型与最先进的学术基线相比表现如何?
  • RQ3反向DNS地理定位在多大程度上可以与商业地理定位数据库互补?在哪些领域其表现优于商业数据库?
  • RQ4隐私保护型数据处理(如将真值数据匿名化至城市级精度)对地理定位系统的可靠性与伦理使用有何影响?
  • RQ5是否可以仅使用公开数据和采样策略,构建并复现一个完全开源的反向DNS地理定位流程?

主要发现

  • 所提方法在中位误差和累积误差距离方面均优于所有三个学术基线,20公里以内的命中率达到54%。
  • DRoP基线表现显著劣于其他方法,凸显了在反向DNS地理定位中结构化特征工程的重要性。
  • 平均而言,该方法的中位误差为43.7公里,虽显著高于商业提供商(16.7公里和11.1公里),但在特定领域仍具竞争力。
  • 该方法在教育机构和政府网络等细分领域表现优异,而商业数据库在这些领域常表现不佳。
  • 该模型输出多个合理位置候选的能力,使其非常适用于与其他地理定位源融合,从而增强整体系统的鲁棒性。
  • 模型、特征生成器和采样策略的开源,使研究社区能够实现完全可复现和可扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。