Skip to main content
QUICK REVIEW

[论文解读] MapReader: A Computer Vision Pipeline for the Semantic Exploration of Maps at Scale

Kasra Hosseini, Daniel Wilson|arXiv (Cornell University)|Nov 30, 2021
Image Processing and 3D Reconstruction被引用 4
一句话总结

MapReader 是一个开源的 Python 库,使历史学家和研究人员能够使用基于图像块的计算机视觉流程,语义化地探索大规模地图集合。通过将 16,000 幅 19 世纪的 Ordnance Survey 地图划分为约 3050 万个图像块,基于 62,020 个专家标注的图像块训练深度学习模型,并将结果与外部数据集关联,该框架实现了对历史空间特征(如铁路基础设施和建筑物)的大规模、可搜索分析。

ABSTRACT

We present MapReader, a free, open-source software library written in Python for analyzing large map collections (scanned or born-digital). This library transforms the way historians can use maps by turning extensive, homogeneous map sets into searchable primary sources. MapReader allows users with little or no computer vision expertise to i) retrieve maps via web-servers; ii) preprocess and divide them into patches; iii) annotate patches; iv) train, fine-tune, and evaluate deep neural network models; and v) create structured data about map content. We demonstrate how MapReader enables historians to interpret a collection of $\\approx$16K nineteenth-century Ordnance Survey map sheets ($\\approx$30.5M patches), foregrounding the challenge of translating visual markers into machine-readable data. We present a case study focusing on British rail infrastructure and buildings as depicted on these maps. We also show how the outputs from the MapReader pipeline can be linked to other, external datasets, which we use to evaluate as well as enrich and interpret the results. We release $\\approx$62K manually annotated patches used here for training and evaluating the models.

研究动机与目标

  • 解决历史学家和地理学家在计算上对大规模、同质化的地图集合进行可搜索分析的挑战。
  • 通过灵活的基于图像块的标注与建模方法,弥合视觉地图特征与机器可读数据之间的语义鸿沟。
  • 在无需计算机视觉专业知识的前提下,利用深度学习实现大规模、可扩展的历史制图数据分析。
  • 创建一个可重复使用、开源的处理流程,支持标注、模型训练,并与外部数据集集成,以支持历史空间分析。

提出的方法

  • 将大地图划分为固定大小、相互重叠的图像块,以创建离散且具有语义意义的分析单元。
  • 采用图像块拼接方法,支持在图像块级别进行迭代标注与模型训练,相比像素级分割,显著提升了数据整理效率。
  • 支持使用标注图像块进行深度神经网络的训练与微调,通过集成多种网络架构的模型以提升性能。
  • 通过将邻近图像块输入独立模型,提取其上下文图像特征,并在最终预测前拼接其嵌入向量。
  • 使用 Web 服务器接口实现地图检索,并通过交互式标注工具支持专家对图像块进行标注。
  • 支持与外部数据集(如历史铁路网络)的集成,以丰富并验证模型输出。

实验结果

研究问题

  • RQ1如何将大规模历史地图集合转化为计算上可搜索、语义结构化的数据源?
  • RQ2基于图像块的深度学习方法在识别 19 世纪 Ordnance Survey 地图中历史特征(如铁路基础设施和建筑物)方面的性能与可扩展性如何?
  • RQ3如何利用专家标注的图像块训练出在国家级地图集合中具有可靠泛化能力的模型?
  • RQ4通过与外部历史与地理空间数据集的集成,模型输出能在多大程度上得到丰富和验证?
  • RQ5基于图像块的方法是否能够支持发现以往通过人工检查无法获取的历史制图数据中的新空间模式?

主要发现

  • MapReader 已成功处理并分析了从 16,000 幅 19 世纪 Ordnance Survey 地图图幅中提取的约 3050 万个地图图像块。
  • 通过在 62,020 个专家标注的图像块的精选数据集上进行迭代模型训练与验证,该框架实现了可靠的模型泛化能力。
  • 集成多种神经网络架构的模型集成方法,显著提升了对复杂空间特征(如铁路空间和建筑物)的预测性能。
  • 基于图像块的方法实现了可扩展、高效的标注与训练,相比像素级分割,在大规模历史地图上的标注成本与可行性方面表现更优。
  • 与外部数据集的集成使模型输出得以验证和丰富,揭示了 19 世纪英国铁路基础设施与城市发展之间空间关系的新见解。
  • MapReader 库及其 62,020 个标注图像块数据集的开源,促进了计算机视觉、机器学习与历史研究社区之间的协作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。