[论文解读] Recurrent Embedding Aggregation Network for Video Face Recognition
该论文提出了一种用于视频人脸识别的循环嵌入聚合网络(REAN),通过长短期记忆网络(LSTM)实现上下文感知注意力机制,对预训练的深度人脸嵌入进行聚合,从而提升对噪声帧的鲁棒性,并在IJB-S、YTF和PaSC数据集上优于CNN-LSTM和质量感知聚合方法,有效保留了判别性特征的同时抑制了噪声。
Recurrent networks have been successful in analyzing temporal data and have been widely used for video analysis. However, for video face recognition, where the base CNNs trained on large-scale data already provide discriminative features, using Long Short-Term Memory (LSTM), a popular recurrent network, for feature learning could lead to overfitting and degrade the performance instead. We propose a Recurrent Embedding Aggregation Network (REAN) for set to set face recognition. Compared with LSTM, REAN is robust against overfitting because it only learns how to aggregate the pre-trained embeddings rather than learning representations from scratch. Compared with quality-aware aggregation methods, REAN can take advantage of the context information to circumvent the noise introduced by redundant video frames. Empirical results on three public domain video face recognition datasets, IJB-S, YTF, and PaSC show that the proposed REAN significantly outperforms naive CNN-LSTM structure and quality-aware aggregation methods.
研究动机与目标
- 解决监控视频中存在噪声和低质量视频帧的人脸识别挑战。
- 通过利用视频序列中的时序上下文信息,在不从头开始微调深度特征的情况下提升识别准确率。
- 开发一种结合质量评估与上下文感知能力的鲁棒聚合机制,以获得更优的特征表示。
- 在标准视频人脸识别基准上超越现有聚合方法(包括平均池化和质量感知模型)。
提出的方法
- REAN使用预训练的卷积神经网络从每帧视频中提取深度人脸嵌入,避免对特征提取器进行端到端训练。
- 长短期记忆网络(LSTM)处理嵌入序列,学习上下文感知的表示,聚焦于帧之间的时序依赖关系。
- LSTM生成注意力权重,根据帧在视频上下文中的相关性和质量动态加权嵌入。
- 通过LSTM生成的注意力分数对嵌入进行加权聚合,形成最终的视频级表示,输出紧凑且具有判别性的向量。
- 将质量感知注意力集成到LSTM框架中,优先选择信息丰富的帧,抑制噪声或低质量帧。
- 对于静态图像(如IJB-S中的图像),使用平均池化代替REAN,以避免分布偏移,因为高质量图像上的质量预测可靠性较低。
实验结果
研究问题
- RQ1是否可以使用循环网络对预训练的人脸嵌入进行聚合,从而提升对噪声视频帧的鲁棒性?
- RQ2在嵌入聚合中引入上下文感知注意力是否能优于仅基于质量或平均池化的方案?
- RQ3REAN能否在包括监控和非受限视频数据在内的多样化视频人脸识别基准上实现有效泛化?
- RQ4在静态图像和视频匹配任务中,REAN与端到端LSTM模型相比,在过拟合和性能方面表现如何?
主要发现
- 在IJB-S的监控到监控协议中,REAN在排名5时相比基线LSTM提升了15.24%,表现出对噪声视频帧的强大鲁棒性。
- 在多视角监控到预订协议中,REAN在1% FPIR下的开集识别性能提升了5.45%,表明其在跨域匹配中的有效性。
- 在YTF数据集中,REAN实现了96.60%的验证准确率,优于C-FAN(96.50%)及其他SOTA方法,尽管YTF的帧质量相对较高。
- 在PaSC数据集中,REAN在手持场景下FAR=0.01时达到96.52%的验证率,优于基线方法并接近最先进水平。
- REAN显著优于朴素的LSTM基线模型,后者在YTF上因过拟合于视频数据而准确率降至60.00%。
- REAN生成的注意力分数通过利用上下文信息,有效识别出具有判别性的帧,实现噪声抑制的同时保留关键面部特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。