[论文解读] Siamese Capsule Networks
本文提出了一种新型架构——Siamese Capsule Networks (SCN),通过利用 $$2-normalized 胞状体姿态特征和对比损失,将胶囊网络扩展至成对学习任务(如人脸识别),在少样本人脸识别任务中取得了最先进性能,尤其在未见主体上表现优异,参数量比 AlexNet 和 ResNet-34 等强基线模型减少 25%。
Capsule Networks have shown encouraging results on extit{defacto} benchmark computer vision datasets such as MNIST, CIFAR and smallNORB. Although, they are yet to be tested on tasks where (1) the entities detected inherently have more complex internal representations and (2) there are very few instances per class to learn from and (3) where point-wise classification is not suitable. Hence, this paper carries out experiments on face verification in both controlled and uncontrolled settings that together address these points. In doing so we introduce extit{Siamese Capsule Networks}, a new variant that can be used for pairwise learning tasks. The model is trained using contrastive loss with $\ell_2$-normalized capsule encoded pose features. We find that extit{Siamese Capsule Networks} perform well against strong baselines on both pairwise learning datasets, yielding best results in the few-shot learning setting where image pairs in the test set contain unseen subjects.
研究动机与目标
- 解决标准胶囊网络在每个类别样本极少的少样本和成对学习设置下的局限性。
- 将胶囊网络扩展至需要学习整体实体间关系的任务(如人脸识别),而非标准图像分类任务。
- 在受控与非受控条件下,评估胶囊网络在复杂真实人脸识别任务中的表现。
- 证明胶囊表示在低数据条件下对空间关系和视角不变性的保留能力。
提出的方法
- 提出 Siamese Capsule Networks (SCN),一种双分支架构,通过权重共享并行处理图像对,以学习联合嵌入表示。
- 使用 $$2-normalized 胞状体编码的姿态向量作为特征表示,以保留空间关系和视角信息。
- 采用对比损失进行模型训练,以最小化同类样本对之间的距离,同时最大化不同类样本对之间的距离。
- 采用迭代动态路由机制计算胶囊间的共识,以实现部件-整体关系和平移等变性。
- 在初始卷积层应用批量归一化,以减少训练损失方差并提升收敛性。
- 评估多种距离度量(欧氏距离、曼哈顿距离)和损失变体(包括双边界)以优化性能。
实验结果
研究问题
- RQ1胶囊网络能否在标准分类方法失效的成对学习任务(如人脸识别)中实现有效泛化?
- RQ2Siamese Capsule Networks 在测试时面对未见主体的少样本学习场景中表现如何?
- RQ3与标准 CNN 相比,使用 $$2-normalized 胞状体姿态特征是否能提升泛化能力和鲁棒性?
- RQ4在低数据条件下,对比损失结合胶囊特征与标准交叉熵损失相比表现如何?
主要发现
- 在少样本学习设置下,Siamese Capsule Networks 在 AT&T 数据集上表现最佳,尤其在测试未见主体时表现突出。
- 在 Labeled Faces in the Wild (LFW) 数据集上,SCN 在参数量减少 25% 的情况下,性能与 AlexNet 和 ResNet-34 相当或更优。
- SCN 在 AT&T 数据集上收敛更快,尤其在使用曼哈顿距离时;同时,批量归一化显著降低了损失方差。
- 采用 $$2-normalized 特征的对比损失相比其他模型,预测方差更低,正样本对匹配精度更高。
- 双边界设置提升了标准 SCN 在 LFW 上的性能,但与 concrete dropout 结合时性能略有下降。
- 尽管参数量更少,SCN 由于训练过程中迭代路由操作,速度仍慢于 CNN。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。