Skip to main content
QUICK REVIEW

[论文解读] Consistently estimating graph statistics using Aggregated Relational Data

Emily Breza, Arun G. Chandrasekhar|arXiv (Cornell University)|Aug 26, 2019
Complex Network Analysis Techniques参考文献 24被引用 6
一句话总结

本文提出了一种基于聚合关系数据(Aggregated Relational Data, ARD)的一致性估计方法,用于个体层面和图层面的统计量估计。在ARD中,受访者报告的是与具有特定特征的群体之间的连接数量,而非成对的联系。通过将ARD调查问题与完整网络的参数化模型相联系,作者建立了关键网络统计量(如度分布和聚类系数)能够从ARD中一致估计的条件,从而实现了对间接调查数据的可靠推断。

ABSTRACT

Aggregated Relational Data, known as ARD, capture information about a social network by asking about the number of connections between a person and a group with a particular characteristic, rather than asking about connections between each pair of individuals directly. Breza et al. (Forthcoming) and McCormick and Zheng (2015) relate ARD questions, consisting of survey items of the form How many people with characteristic X do you know? to parametric statistical models for complete graphs. In this paper, we propose criteria for consistent estimation of individual and graph level statistics from ARD data.

研究动机与目标

  • 为解决从ARD中估计网络统计量的挑战,其中直接的成对联系无法观测。
  • 识别在何种条件下,个体层面和图层面的统计量能够从ARD调查回答中一致估计。
  • 形式化AR D问题(如“你认识多少位具有特征X的人?”)与完整社会网络参数化模型之间的联系。
  • 为将ARD作为社会科学研究中有效网络数据来源提供理论基础。
  • 确保即使仅能获得聚合关系信息,网络特征的估计量仍具有一致性。

提出的方法

  • 将ARD形式化为一种调查机制,其获取的是个体与按特征定义的群体之间的连接数量,而非个体之间的直接联系。
  • 使用参数化统计模型来建模潜在的完整网络,以表示真实的网络结构。
  • 推导出确保从ARD中对个体和图层面统计量进行一致估计的识别限制条件。
  • 建立正则性条件,使ARD回答的经验分布收敛于真实网络统计量。
  • 利用来自参数化网络模型的矩条件来估计度分布和聚类系数等统计量。
  • 应用逆概率加权或估计方程,以校正ARD回答中的抽样和报告偏差。

实验结果

研究问题

  • RQ1在何种条件下,个体层面的网络统计量能够从ARD中一致估计?
  • RQ2图层面的统计量(如聚类系数)能否从ARD数据中一致恢复?
  • RQ3完整网络的参数化模型如何与关于群体连接的ARD调查问题相联系?
  • RQ4为确保从ARD中一致估计,需要哪些识别假设?
  • RQ5在实证研究中,ARD在多大程度上可作为完整网络数据的可靠代理?

主要发现

  • 本文建立了充分条件,表明个体层面的统计量(如度分布)能够从ARD中一致估计。
  • 若潜在网络模型满足特定正则性和矩条件,图层面的统计量(如聚类系数)可被一致估计。
  • 估计量的一致性依赖于将ARD回答与真实网络结构相联系的参数化模型的正确设定。
  • 只要识别假设成立,即使无法直接观测成对联系,该方法仍可实现一致推断。
  • 该框架使ARD可作为大规模社会调查中估计网络特征的有效数据源。
  • 理论结果表明,在较弱的正则性条件下,ARD仍能产生一致估计,从而扩展了基于调查的网络数据的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。