[论文解读] Networked Inequality: Preferential Attachment Bias in Graph Neural Network Link Prediction
本文识别出在使用对称归一化的图卷积网络(GCNs)中存在一种此前未被探索的组内优先连接偏差,其中链接预测得分与社交群体内节点度数的几何平均值相关。作者通过理论和实证分析证明,这种偏差会加剧度数和权力的不平等,尤其对低度数个体更为不利。为此,他们提出了一种新颖的组内公平性度量方法,并引入一种训练时正则化策略,有效降低了引文、社交和信用网络中的不公平性。
Graph neural network (GNN) link prediction is increasingly deployed in citation, collaboration, and online social networks to recommend academic literature, collaborators, and friends. While prior research has investigated the dyadic fairness of GNN link prediction, the within-group (e.g., queer women) fairness and "rich get richer" dynamics of link prediction remain underexplored. However, these aspects have significant consequences for degree and power imbalances in networks. In this paper, we shed light on how degree bias in networks affects Graph Convolutional Network (GCN) link prediction. In particular, we theoretically uncover that GCNs with a symmetric normalized graph filter have a within-group preferential attachment bias. We validate our theoretical analysis on real-world citation, collaboration, and online social networks. We further bridge GCN's preferential attachment bias with unfairness in link prediction and propose a new within-group fairness metric. This metric quantifies disparities in link prediction scores within social groups, towards combating the amplification of degree and power disparities. Finally, we propose a simple training-time strategy to alleviate within-group unfairness, and we show that it is effective on citation, social, and credit networks.
研究动机与目标
- 研究网络结构中的度数偏差如何影响图神经网络(GNN)链接预测的公平性。
- 识别并分析在使用对称归一化图滤波器的GCNs中此前未被探索的组内优先连接(PA)偏差。
- 通过引入新的组内公平性度量,将GCN的PA偏差与链接预测中的不公平性联系起来。
- 提出并评估一种训练时正则化策略,以减轻基于GCN的链接预测中的组内不公平性。
- 在包括引文、合作、在线社交和信用网络在内的多种真实世界网络中验证研究发现。
提出的方法
- 理论分析表明,使用对称归一化图滤波器的GCNs生成的链接预测得分与组内节点度数的几何平均值成正比,表明存在组内PA偏差。
- 提出一种新的组内公平性度量 $\widehat{\Delta}^{(b)}$,用于基于度数差异量化社会群体之间链接预测得分的不平等。
- 引入一种训练时正则化损失 $\mathcal{L}_{\text{fair}}$,用于惩罚同一组内不同度数节点之间的不公平链接预测得分差异。
- 该方法在引文网络(CORA, CITESEER, DBLP, PUBMED)、合作网络(CS, PHYSICS)、在线社交网络(LASTFMASIA, DE, EN, FR)和信用网络(NBA, GERMAN, DBLP-Fairness)上进行了评估。
- 通过比较两层和四层GCN编码器,验证了理论发现的模型深度鲁棒性。
- 使用NRMSE和PCC指标将链接预测得分的理论预测值与实际GCN输出进行对比,以验证PA偏差假设。
实验结果
研究问题
- RQ1使用对称归一化的GCN是否在链接预测中表现出组内优先连接偏差?
- RQ2这种偏差如何加剧社交网络中的度数和权力不平等,特别是在学术和合作环境中?
- RQ3所提出的新型组内公平性度量能否有效量化基于节点度数的组内链接预测得分差异?
- RQ4训练时正则化策略在多大程度上能减轻GCN链接预测中的组内不公平性?
- RQ5PA偏差是否存在于使用随机游走归一化的GCNs中,还是仅限于对称归一化?
主要发现
- 使用对称归一化图滤波器的GCNs表现出组内优先连接偏差,其中链接预测得分与同一社交群体内两个节点度数的几何平均值成正比。
- 基于度数乘积和特征相似性的链接预测得分理论预测与实际GCN输出高度相关,PCC值在不同数据集上介于0.752至0.950之间。
- 所提出的公平性度量 $\widehat{\Delta}^{(b)}$ 有效捕捉了同一组内高低度数节点之间链接预测得分的差异,大多数数据集的NRMSE值低于0.06。
- 训练时正则化策略将公平性损失 $\mathcal{L}_{\text{fair}}$ 最多降低75%(例如,NBA中从0.122降至0.000,GERMAN中从0.028降至0.000),同时保持或略微提升测试AUC。
- 该方法在多种网络类型中均有效:引文网络(CORA, DBLP)、合作网络(CS, PHYSICS)、在线社交网络(LASTFMASIA, EN)和信用网络(NBA, GERMAN)。
- 即使在更深的四层GCN编码器中,理论与实证结果仍持续支持组内PA偏差的存在,且NRMSE和PCC值保持相当或更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。