Skip to main content
QUICK REVIEW

[论文解读] Building a large synthetic population from Australian census data

Bhagya N. Wickramasinghe, Dhirendra Singh|arXiv (Cornell University)|Aug 18, 2020
demographic modeling and climate adaptation参考文献 18被引用 4
一句话总结

本文提出了一种无需样本的群体合成算法,利用2016年澳大利亚人口普查数据,在标准计算机上不到三分钟内生成了墨尔本大都会区约450万名居民、180多万个家庭的高保真合成人口。该方法基于ABS TableBuilder提供的联合边际分布,采用基于启发式的家庭与个体分配策略,实现了与人口普查家庭层级数据的完全匹配,并在个人层级属性上达到超过98%的余弦相似度,所有结果均精确无误。

ABSTRACT

We present work on creating a synthetic population from census data for Australia, applied to the greater Melbourne region. We use a sample-free approach to population synthesis that does not rely on a disaggregate sample from the original population. The inputs for our algorithm are joint marginal distributions from census of desired person-level and household-level attributes, and outputs are a set of comma-separated-value (.csv) files containing the full synthetic population of unique individuals in households; with age, gender, relationship status, household type, and size, matched to census data. Our algorithm is efficient in that it can create the synthetic population for Melbourne comprising 4.5 million persons in 1.8 million households within three minutes on a modern computer. Code for the algorithm is hosted on GitHub.

研究动机与目标

  • 开发一种可扩展的、无需样本的澳大利亚人口普查数据群体合成方法,且不依赖微观数据样本。
  • 为城市规划与应急管理工作中的基于代理的模拟生成高保真度的合成人口。
  • 仅使用ABS提供的联合边际分布,确保家庭结构与个人层级属性的准确表示。
  • 实现跨所有澳大利亚统计区域二级(SA2)区域的一致性、开源化应用。
  • 在先前无需样本方法的基础上进行改进,采用最新的2016年人口普查数据、精确的年龄分布,以及可配置的伴侣年龄差启发式规则。

提出的方法

  • 该算法使用澳大利亚统计局(ABS)TableBuilder提供的个人层级(年龄、性别、关系)与家庭层级(规模、类型)属性的联合边际分布。
  • 采用基于启发式的分配方法将个体分配至家庭,将家庭分布作为参考基准,以确保与人口普查数据完全对齐。
  • 通过分配符合边际分布的属性,同时保持现实的家庭构成与关系结构,生成唯一个体。
  • 引入可配置的伴侣年龄差启发式规则,替代先前工作中使用的均匀年龄分配方式,以提升准确性。
  • 算法在SA2层级(约10,000名居民)处理数据,支持区域尺度的合成人口生成。
  • 最终输出以逗号分隔值(CSV)文件形式存储,可直接用于基于代理的模拟,完整源代码托管于GitHub。

实验结果

研究问题

  • RQ1无需依赖微观数据的群体合成算法是否能在不使用样本的情况下,实现对个人层级与家庭层级人口普查分布的高精度匹配?
  • RQ2与成熟的IPF(迭代比例调整)和IPU(迭代比例更新)方法相比,该算法在精度与运行时间方面的表现如何?
  • RQ3相较于均匀年龄分配,使用精确年龄分布与可配置的伴侣年龄差启发式规则,在多大程度上提升了合成人口的真实性?
  • RQ4该算法是否能高效扩展,实现在标准硬件上三分钟内生成完整大都市区合成人口(如墨尔本的450万人口)?
  • RQ5在不同人口普查年份(2011年 vs. 2016年)与不同区域(SA2)下,该算法在分布保真度方面的表现如何变化?

主要发现

  • 该算法在现代计算机上仅用150秒,利用2016年人口普查数据,为墨尔本大都会区生成了4,485,211名个人、1,832,043个家庭的合成人口。
  • 该合成人口与2016年人口普查数据中全部65项家庭层级分布实现了完全匹配(100%)。
  • 在个人层级属性方面,该算法在所有测试类别(如年龄、性别、关系状态)中与原始人口普查数据的余弦相似度均达到98.6%或以上。
  • 与IPU相比,该算法在家庭层级分布上实现了完美匹配(在2011年数据中278个SA2区域均达100%),而IPU的准确率为99.6%。
  • 尽管使用了不同的普查年份,该方法在个人层级分布精度上仍优于Huynh等人[10]的工作(差异小于2%,而其2006年数据中差异达10%)。
  • 该算法的运行时间(150秒)与IPU(107秒)相当,尽管其无需迭代加权或微观数据采样。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。