[论文解读] Learning to Cluster Faces via Confidence and Connectivity Estimation
本文提出了一种完全可学习的面部聚类框架,通过使用两个图卷积网络(GCN-V 和 GCN-E)将聚类建模为顶点置信度与边连通性的联合估计。通过将每个顶点连接到置信度更高、连接更强的邻居,该方法将亲和图划分为自然聚类,在 MS1M-584K 和 DeepFashion 等大规模数据集上实现了最先进(SOTA)的准确率,并比以往的监督方法快了10倍。
Face clustering is an essential tool for exploiting the unlabeled face data, and has a wide range of applications including face annotation and retrieval. Recent works show that supervised clustering can result in noticeable performance gain. However, they usually involve heuristic steps and require numerous overlapped subgraphs, severely restricting their accuracy and efficiency. In this paper, we propose a fully learnable clustering framework without requiring a large number of overlapped subgraphs. Instead, we transform the clustering problem into two sub-problems. Specifically, two graph convolutional networks, named GCN-V and GCN-E, are designed to estimate the confidence of vertices and the connectivity of edges, respectively. With the vertex confidence and edge connectivity, we can naturally organize more relevant vertices on the affinity graph and group them into clusters. Experiments on two large-scale benchmarks show that our method significantly improves clustering accuracy and thus performance of the recognition models trained on top, yet it is an order of magnitude more efficient than existing supervised methods.
研究动机与目标
- 解决基于启发式子图的监督聚类方法存在的高冗余与性能瓶颈问题。
- 通过最小化所需子图数量来降低计算成本,同时保持或提升聚类准确率。
- 开发一种完全可学习的框架,端到端预测顶点置信度与边连通性,无需人工设计或启发式假设。
- 提升大规模无标签面部数据的聚类性能,以增强下游面部识别模型。
- 通过在 DeepFashion 基准上的评估,证明方法在面部数据之外的泛化能力。
提出的方法
- 将面部聚类建模为两阶段学习问题:估计顶点置信度(属于某类的概率)与边连通性(两个顶点属于同一聚类的概率)。
- 设计 GCN-V,一种图卷积网络,以完整亲和图作为输入,同时预测所有顶点的置信度分数。
- 设计 GCN-E,一种局部化图卷积网络,利用候选邻居集合评估边连通性,学习预测两个顶点属于同一聚类的可能性。
- 通过将每个顶点连接到其最高置信度且连通性最强的邻居来构建聚类,形成类似树状的结构,自然地表示聚类。
- 利用 GCN 的顶层特征嵌入(F_L)动态重建亲和图,从而在不进行完整重计算的情况下提升连通性估计。
- 引入超参数 ρ 以控制 GCN-E 应用于的高置信度顶点比例,实现计算成本与性能之间的平衡。
实验结果
研究问题
- RQ1完全可学习的聚类框架是否能够消除以往监督方法中使用的启发式子图构建与预测聚合步骤?
- RQ2顶点置信度与边连通性的联合估计是否能带来比传统基于子图或无监督方法更准确的聚类结果?
- RQ3通过减少所需子图数量,是否能显著提升计算效率而不损失聚类准确率?
- RQ4使用变换后的特征嵌入(F_L)进行图重建,对连通性估计与整体聚类性能有何影响?
- RQ5该方法在面部数据集之外的泛化能力如何,例如在时尚图像聚类任务中?
主要发现
- 所提方法在 MS1M-584K 与 DeepFashion 基准上均实现了最先进性能,在 F_P 指标下,MS1M-584K 的 F1 分数达到 87.14,DeepFashion 达到 57.26。
- 使用变换后的嵌入(F_L)进行图重建,相比使用原始特征,性能有所提升,F_P 从 MS1M-584K 的 82.76 提升至 87.14。
- 该方法比现有监督聚类基线快一个数量级,显著减少了因子图重叠导致的冗余计算。
- 仅对前 10% 的高置信度顶点应用 GCN-E(ρ=0.1)即可实现显著的性能提升,且计算成本极低。
- 当 GCN-E 应用于所有顶点(ρ=1)时,性能下降,表明不置信的顶点引入了复杂且难以学习的连通性模式。
- 该方法在非面部数据集上也表现出良好的泛化能力,在 DeepFashion 基准上取得了优异性能,表明其在面部识别之外具有广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。