[论文解读] How to Train Triplet Networks with 100K Identities?
本文提出一种子空间学习方法,通过将身份划分为相似身份的子空间,实现对10万身份的三元组网络训练,结合批量在线难样本挖掘(OHNM),实现更有效的难样本挖掘。该方法在MS-Celeb-1M Challenge1上达到最先进性能,LFW准确率达到99.48%,随机集上召回率达到75%,达到理论上限,且无需外部数据。
Training triplet networks with large-scale data is challenging in face recognition. Due to the number of possible triplets explodes with the number of samples, previous studies adopt the online hard negative mining(OHNM) to handle it. However, as the number of identities becomes extremely large, the training will suffer from bad local minima because effective hard triplets are difficult to be found. To solve the problem, in this paper, we propose training triplet networks with subspace learning, which splits the space of all identities into subspaces consisting of only similar identities. Combined with the batch OHNM, hard triplets can be found much easier. Experiments on the large-scale MS-Celeb-1M challenge with 100K identities demonstrate that the proposed method can largely improve the performance. In addition, to deal with heavy noise and large-scale retrieval, we also make some efforts on robust noise removing and efficient image retrieval, which are used jointly with the subspace learning to obtain the state-of-the-art performance on the MS-Celeb-1M competition (without external data in Challenge1).
研究动机与目标
- 解决在大规模(10万身份)下训练三元组网络的挑战,标准在线难负样本挖掘因难样本稀疏而失效。
- 通过将身份组织为相似身份的子空间,克服在大规模人脸识别中寻找有效难样本的困难。
- 通过引入噪声去除与分层检索技术,提升大规模、噪声数据集的训练效率与模型鲁棒性。
- 在不使用外部数据的情况下,于MS-Celeb-1M Challenge1上实现最先进性能,尤其在难样本集上召回率显著提升。
提出的方法
- 基于身份表征进行聚类,将整个身份空间划分为仅包含相似身份的子空间。
- 在每个子空间内应用批量在线难负样本挖掘(OHNM),高效发现语义上有意义且对训练有效的难样本三元组。
- 提出一种三步噪声去除方法,利用预训练分类模型识别并移除噪声人脸图像,提升数据质量。
- 实施两层分层检索策略,将搜索空间从504万降低至每查询约10万 + 50个候选,显著加速推理。
- 在检索流程中使用GPU加速矩阵乘法,实现每张图像推理时间低于0.1秒。
- 将子空间学习、噪声去除与分层检索整合为端到端的大规模人脸识别流水线。
实验结果
研究问题
- RQ1在10万身份的三元组网络训练中,如何可靠地挖掘出有效的难样本三元组,其中采样到相似身份的概率极低?
- RQ2身份的子空间聚类是否能提升训练过程中难样本三元组的质量与可发现性?
- RQ3大规模数据集(如MS-Celeb-1M)中的噪声如何影响三元组网络性能?有哪些策略能有效清理此类数据?
- RQ4何种检索策略可在大规模(500万张图像)下实现高效且精确的人脸识别,同时不牺牲精度?
- RQ5仅使用子空间学习与数据清洗的单一三元组网络,是否能在不依赖外部数据的情况下于MS-Celeb-1M上实现最先进性能?
主要发现
- 所提出的子空间学习结合批量OHNM方法达到99.48%的LFW准确率,优于标准三元组训练方法,且接近使用800万身份的FaceNet的99.63%准确率。
- 在不使用外部数据的MS-Celeb-1M Challenge1中,该方法在随机集上达到75%的召回率——达到理论上限。
- 难样本集的召回率达到60.6%,显著优于先前方法(如CIGIT_NLPR的53.4%),展现出对难样本的强鲁棒性。
- 噪声去除方法达到99.36%的LFW准确率,优于原始数据与固定比例基线,表明其在噪声处理方面具有优越性能。
- 结合GPU加速的两层分层检索将每张图像的检索时间缩短至0.052秒,约一小时内可完成5万张测试图像的完整推理。
- 与使用外部数据的团队相比,该方法表现具有竞争力,难样本集召回率达60.6%——超过SmileLab(61%)与Panasonic-NUS(79.1%)在精度优化召回率上的表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。