[论文解读] Permutation-invariant Feature Restructuring for Correlation-aware Image Set-based Recognition
本文提出了一种用于基于图像集识别的排列不变特征重构(PIFR)框架,通过参数化残差自注意力(RSA)模块和非参数化依赖引导特征对齐(DFA)模块,同时建模集合内和集合间相关性。该方法通过交替优化方案联合优化深度特征与稀疏重建系数,在人脸识别和行人重识别基准上实现了最先进性能。
We consider the problem of comparing the similarity of image sets with variable-quantity, quality and un-ordered heterogeneous images. We use feature restructuring to exploit the correlations of both inner$\&$inter-set images. Specifically, the residual self-attention can effectively restructure the features using the other features within a set to emphasize the discriminative images and eliminate the redundancy. Then, a sparse/collaborative learning-based dependency-guided representation scheme reconstructs the probe features conditional to the gallery features in order to adaptively align the two sets. This enables our framework to be compatible with both verification and open-set identification. We show that the parametric self-attention network and non-parametric dictionary learning can be trained end-to-end by a unified alternative optimization scheme, and that the full framework is permutation-invariant. In the numerical experiments we conducted, our method achieves top performance on competitive image set/video-based face recognition and person re-identification benchmarks.
研究动机与目标
- 解决真实生物识别应用中图像集包含可变、无序且异质图像所带来的比较挑战。
- 克服现有方法忽略集合内相关性或对图像顺序敏感的局限性。
- 在闭集与开集识别场景中实现有效的相似性度量。
- 开发一种统一的、端到端可训练的框架,对图像集排列保持不变,并能高效扩展至开集识别。
提出的方法
- 提出一种残差自注意力(RSA)模块,通过成对亲和力重构集合内特征,突出判别性图像并减少冗余。
- 通过全卷积特征提取器与高斯相似性度量引入空间线索,以增强特征表示。
- 设计一种非参数化依赖引导特征对齐(DFA)模块,利用画廊特征的稀疏/协作表示重建探测特征。
- 采用交替优化方案,端到端联合训练参数化RSA与非参数化字典学习组件。
- 通过注意力机制与稀疏重建机制,使RSA与DFA模块独立于输入顺序,确保排列不变性。
- 通过利用协作表示相似性对画廊主体进行排序,将框架适配于验证与开集识别任务。
实验结果
研究问题
- RQ1如何在不依赖序列处理的前提下,有效建模无序、可变大小图像集内的集合内相关性?
- RQ2如何在排列不变的前提下,利用集合间相关性提升探测-画廊特征对齐效果?
- RQ3统一框架能否同时优化参数化深度学习与非参数化字典学习,以实现图像集识别?
- RQ4同时引入集合内与集合间相关性,在开集与闭集识别基准上的性能提升程度如何?
- RQ5与顺序敏感或无相关性感知的基线方法相比,所提方法在鲁棒性与准确性方面表现如何?
主要发现
- 在IJB-A闭集人脸识别基准上,PIFR使用ResNet50主干网络实现94.97%的rank-1准确率,优于此前最先进方法超过4个百分点。
- 在Celebrity-1000开集数据集上,PIFR使用ResNet50主干网络实现87.13%的rank-1准确率,较DAC提升4%,较平均池化基线提升超过9%。
- 在iLIDS-VID行人重识别任务中,PIFR使用ResNet50主干网络实现82.5%的rank-1准确率(无需光流),优于STAN 10.8个百分点,优于TCP 2.3个百分点。
- 消融实验表明,移除残差差异项(RSAw/o Δ)会降低性能,验证了RSA模块设计选择的有效性。
- 在RSA中使用嵌入式高斯亲和力(ΨΦ)^L可获得相似性能,但训练时间超过两倍,表明所提方法具有更高效率。
- 框架完全具备排列不变性,如输入集合中图像顺序变化时性能保持一致所证实。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。