Skip to main content
QUICK REVIEW

[论文解读] Urban Visual Intelligence: Studying Cities with AI and Street-level Imagery

Fan Zhanga, Arianna Salazar Miranda|arXiv (Cornell University)|Jan 2, 2023
Urban Design and Spatial Analysis被引用 5
一句话总结

本文提出了城市视觉智能(Urban Visual Intelligence)这一概念性框架,利用街景图像与深度学习技术,系统分析城市物理环境及其与社会经济因素的相互作用。通过整合人工智能驱动的视觉分析与城市理论,该方法实现了前所未有的空间与时间分辨率,为城市形态、感知及人类行为提供可扩展、数据驱动的洞察。

ABSTRACT

The visual dimension of cities has been a fundamental subject in urban studies, since the pioneering work of scholars such as Sitte, Lynch, Arnheim, and Jacobs. Several decades later, big data and artificial intelligence (AI) are revolutionizing how people move, sense, and interact with cities. This paper reviews the literature on the appearance and function of cities to illustrate how visual information has been used to understand them. A conceptual framework, Urban Visual Intelligence, is introduced to systematically elaborate on how new image data sources and AI techniques are reshaping the way researchers perceive and measure cities, enabling the study of the physical environment and its interactions with socioeconomic environments at various scales. The paper argues that these new approaches enable researchers to revisit the classic urban theories and themes, and potentially help cities create environments that are more in line with human behaviors and aspirations in the digital age.

研究动机与目标

  • 解决缺乏标准化、系统化方法来量化城市空间视觉数据中物理环境的问题。
  • 通过视觉智能重新评估可识别性、社会无序与城市美学等概念,弥合经典城市理论与现代人工智能及大数据之间的鸿沟。
  • 通过利用带有地理标签的街景图像与深度学习技术,实现城市环境的大规模、可扩展分析。
  • 通过从视觉线索中提取可解释、可操作的见解,支持城市规划与设计,了解社区特征、安全性和活力。
  • 探索生成式人工智能模型在基于学习到的视觉与感知模式模拟和设计城市环境方面的潜力。

提出的方法

  • 以谷歌街景等来源的带地理标签街景图像是城市视觉分析的主要数据源。
  • 采用深度卷积神经网络(DCNNs)与生成对抗网络(GANs)提取并生成逼真的城市场景表示。
  • 应用迁移学习与预训练模型(如ResNet、VGG)对建筑风格、植被、垃圾与车辆类型等视觉属性进行分类。
  • 整合场景生成技术,基于用户定义的输入(如土地利用、建筑密度、道路类型)模拟城市环境。
  • 使用可解释的人工智能模型揭示物理环境特征与社会经济指标之间的因果关系。
  • 应用空间分析,识别城市物理特征组织在不同尺度下的一致性模式。

实验结果

研究问题

  • RQ1如何系统性地量化街景图像中的视觉信息,以表征城市空间的物理环境?
  • RQ2人工智能技术在多大程度上可增强对城市品质(如吸引力、安全性、活力)的测量?
  • RQ3诸如涂鸦、垃圾与车辆类型等视觉线索如何与社区的社会经济及心理社会指标相关联?
  • RQ4生成式人工智能模型能否基于感知与结构输入准确模拟并修改城市环境?
  • RQ5何种空间尺度与组织单元最能体现城市物理环境的基本结构?

主要发现

  • 街景图像与深度学习可实现可扩展、高分辨率的城市物理环境分析,其效率与覆盖范围超越传统观察方法。
  • 从图像中提取的视觉线索(如破损窗户、涂鸦、垃圾)可作为衡量社区社会无序程度的可靠代理指标。
  • 基于图像推导出的车辆类型与拥有模式与社区人口统计特征及政治倾向相关,提供了新的社会经济指标。
  • 生成对抗网络(GANs)可基于学习到的视觉模式生成逼真的城市场景,支持情景规划与设计探索。
  • 可解释的人工智能模型揭示了城市分析中的混杂因素,相比黑箱模型,显著提升了政策相关见解的可靠性。
  • 该框架表明城市物理特征存在一致的空间模式,暗示可能存在城市组织的基本空间单元。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。