[论文解读] Ada-NETS: Face Clustering via Adaptive Neighbour Discovery in the Structure Space
Ada-NETS 提出了一种新颖的人脸聚类方法,通过将特征转换到结构空间并采用自适应邻居发现策略,减轻了基于 GCN 的人脸图中的噪声边。该方法通过增强特征鲁棒性并减少噪声连接,实现了 SOTA 性能,在基准数据集上达到 95.51% 的 Pairwise F-score 和 94.93% 的 BCubed F-score,其核心在于通过学习的邻居选择机制构建干净且丰富的图结构。
Face clustering has attracted rising research interest recently to take advantage of massive amounts of face images on the web. State-of-the-art performance has been achieved by Graph Convolutional Networks (GCN) due to their powerful representation capacity. However, existing GCN-based methods build face graphs mainly according to kNN relations in the feature space, which may lead to a lot of noise edges connecting two faces of different classes. The face features will be polluted when messages pass along these noise edges, thus degrading the performance of GCNs. In this paper, a novel algorithm named Ada-NETS is proposed to cluster faces by constructing clean graphs for GCNs. In Ada-NETS, each face is transformed to a new structure space, obtaining robust features by considering face features of the neighbour images. Then, an adaptive neighbour discovery strategy is proposed to determine a proper number of edges connecting to each face image. It significantly reduces the noise edges while maintaining the good ones to build a graph with clean yet rich edges for GCNs to cluster faces. Experiments on multiple public clustering datasets show that Ada-NETS significantly outperforms current state-of-the-art methods, proving its superiority and generalization. Code is available at https://github.com/damo-cv/Ada-NETS.
研究动机与目标
- 为解决基于 GCN 的人脸聚类中噪声边这一关键问题,此类噪声边会因不同类别人脸之间的错误连接而损害特征学习。
- 提升人脸图构建中邻居选择的可靠性,传统方法通常基于特征空间中的 k-NN,但易受特征不准确的影响。
- 开发一种方法,可自适应地确定每张人脸的邻居数量,同时最小化噪声边并保留有意义的连接。
- 通过利用局部结构模式增强特征表示,从而生成更具鲁棒性和判别性的嵌入以用于聚类。
- 通过结合结构空间变换与 GCN 中的自适应邻居发现策略,在公开基准上实现卓越的聚类性能。
提出的方法
- 将人脸特征转换到结构空间,使每张人脸编码来自邻近图像的纹理和分布信息,从而提升特征鲁棒性。
- 提出一种基于局部特征一致性的候选邻居质量准则,以指导高质量邻居的选择。
- 采用可学习的自适应滤波器,通过回归方法估计每张人脸的最优邻居数量(k_off),避免固定 k-NN 的启发式方法。
- 使用启发式质量评分对候选邻居进行排序,并动态选择能最大化结构一致性和最小化类间连接的子集。
- 利用所选邻居构建干净且丰富的图结构,并将其输入 GCN 以进行消息传递和增强的特征学习。
- 利用 GCN 的图嵌入生成紧凑且具有判别性的特征,从而提升聚类性能。
实验结果
研究问题
- RQ1将人脸特征转换到结构空间是否能降低噪声 k-NN 连接在人脸聚类图中的影响?
- RQ2如何自适应地确定每张人脸的邻居数量,以在最小化噪声边的同时保留有信息量的连接?
- RQ3与固定 k-NN 或基于注意力的方法相比,使用可学习滤波器估计 k_off 是否能提升聚类性能?
- RQ4所提出的自适应邻居发现策略是否能在多种不同的人脸聚类数据集中保持一致的性能表现?
- RQ5与标准特征空间相比,结构空间在多大程度上提升了特征的判别性以及聚类 F-score?
主要发现
- Ada-NETS 在基准数据集上实现了 95.51% 的 Pairwise F-score 和 94.93% 的 BCubed F-score,显著优于当前 SOTA 方法。
- 该方法在不同 k 值下均保持稳定性能,相比 k-NN 和基于阈值的基线方法,表现出更强的超参数鲁棒性。
- GCN 与 Ada-NETS 及结构空间结合生成的图嵌入在十亿组随机配对中表现出最佳的 ROC 性能,表明其具有更优的特征判别能力。
- 特征可视化结果表明,结构空间中的嵌入在每类内部更加紧凑,支持聚类性能的提升。
- 采用 k_off 回归的自适应滤波器(E^k_reg)性能优于其他方法(如 Q 值回归或分类),且参数更少。
- 基于注意力的方法(如 GAT)未能超越 Ada-NETS,原因在于复杂且非均匀的特征模式阻碍了注意力权重的学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。