[论文解读] Subsampling large graphs and invariance in networks
本文通过将随机子采样与分布不变性及遍历性联系起来,为从大型网络中单个子图采样学习建立了理论基础。结果表明,在特定采样算法下——尤其是作为随机群变换极限出现的算法——采样会诱导出可交换或不变的模型(例如图子),从而通过不变性实现对底层网络结构的几乎必然识别,实现从单一实现中的一致推断。
Specify a randomized algorithm that, given a very large graph or network, extracts a random subgraph. What can we learn about the input graph from a single subsample? We derive laws of large numbers for the sampler output, by relating randomized subsampling to distributional invariance: Assuming an invariance holds is tantamount to assuming the sample has been generated by a specific algorithm. That in turn yields a notion of ergodicity. Sampling algorithms induce model classes---graphon models, sparse generalizations of exchangeable graphs, and random multigraphs with exchangeable edges can all be obtained in this manner, and we specialize our results to a number of examples. One class of sampling algorithms emerges as special: Roughly speaking, those defined as limits of random transformations drawn uniformly from certain sequences of groups. Some known pathologies of network models based on graphons are explained as a form of selection bias.
研究动机与目标
- 建立在何种条件下,从大型网络中采样得到的单个子图能够对原始网络实现一致推断。
- 形式化随机子采样算法与分布不变性(尤其是可交换性与遍历性)之间的联系。
- 表征由此类采样过程所诱导的模型类别(例如图子、稀疏随机图)。
- 识别出采样子图分布唯一确定输入网络结构的条件。
- 通过将图子模型中的已知病态现象解释为特定采样机制引起的选取偏差,来解决这些问题。
提出的方法
- 提出一个正式的极限框架:当输入图大小 $ n \to \infty $ 时,通过随机算法采样的 $ k $-顶点子图的分布收敛于极限分布 $ P_y = \mathcal{L}(S_\infty(y)) $。
- 利用变换群下的分布不变性(例如可交换性)来定义遍历模型,使得单一样本几乎必然确定底层分布。
- 引入一个规范充分统计量 $ \mathbf{t}(y) $,将网络映射为前缀密度 $ (t_{x_k}(y)) $ 的无穷维向量,表示 $ k $-顶点诱导子图的分布律。
- 应用博雷尔截面定理,构造可测选择算子 $ \sigma_Q $,使得 $ \mathbf{t}(\sigma_Q(s)) = s $ 几乎必然成立,从而实现从子图中几乎必然恢复网络特征。
- 表征可解采样算法为满足 $ y \equiv_{\text{S}} y' $ 当且仅当 $ \mathbf{t}(y) = \mathbf{t}(y') $ 的算法,确保模型可识别性。
- 分析前缀密度 $ \mathbf{t}^{(k)}(y) = \mathcal{L}(S_k(y)) $ 作为 $ n $ 的网状收敛,证明在图空间收敛下,充分统计量的连续性。
实验结果
研究问题
- RQ1在何种条件下,从大型网络中采样的单个子图包含足够信息以推断原始网络结构?
- RQ2随机子采样算法如何诱导出如可交换性等分布对称性?它们生成了哪些模型类别?
- RQ3采样子图的极限分布在何种情况下是遍历的,使得单一样本几乎必然唯一确定底层分布?
- RQ4在变换群下的不变性在确保从单一样本中实现一致推断中起什么作用?
- RQ5为何图子模型中会出现某些病态现象?它们能否被解释为特定采样机制引起的选取偏差?
主要发现
- 当且仅当极限子图分布相对于适当变换群保持不变时,采样算法才会诱导出模型类别(例如图子、稀疏可交换图)。
- 极限子图分布 $ P_y = \mathcal{L}(S_\infty(y)) $ 是遍历的,当且仅当采样算法满足特定不变性条件,从而实现从单一样本中几乎必然识别。
- 充分统计量 $ \mathbf{t}(y) $,即将每个网络映射为所有前缀子图密度向量的映射,在网络收敛的拓扑下是连续的。
- 对于可解采样算法,$ y \equiv_{\text{S}} y' $ 当且仅当 $ \mathbf{t}(y) = \mathbf{t}(y') $,确保不同网络产生不同的子图分布。
- 存在可测选择算子 $ \sigma_Q $,使得 $ \mathbf{t}(\sigma_Q(s)) = s $ 几乎必然成立,这意味着相对于 $ \mathbf{t} $ 可测的特征 $ f(y) $ 可从子图中几乎必然恢复。
- 已知的图子模型病态现象被证明源于非可解采样算法引起的选取偏差,特别是那些并非作为均匀随机群作用极限出现的算法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。