[论文解读] CNN Retrieval based Unsupervised Metric Learning for Near-Duplicated Video Retrieval
该论文提出了一种基于CNN的无监督度量学习框架,用于近似重复视频检索(NDVR),通过融合预训练网络的中间卷积层和全连接层的特征,结合无监督度量学习与基于k-近邻的重排序策略,在CC_WEB_VIDEO数据集上实现了0.9790的SOTA mAP。
As important data carriers, the drastically increasing number of multimedia videos often brings many duplicate and near-duplicate videos in the top results of search. Near-duplicate video retrieval (NDVR) can cluster and filter out the redundant contents. In this paper, the proposed NDVR approach extracts the frame-level video representation based on convolutional neural network (CNN) features from fully-connected layer and aggregated intermediate convolutional layers. Unsupervised metric learning is used for similarity measurement and feature matching. An efficient re-ranking algorithm combined with k-nearest neighborhood fuses the retrieval results from two levels of features and further improves the retrieval performance. Extensive experiments on the widely used CC\_WEB\_VIDEO dataset shows that the proposed approach exhibits superior performance over the state-of-the-art.
研究动机与目标
- 解决大规模高冗余视频数据集中近似重复视频检索的挑战。
- 通过融合来自中间卷积层的低级特征(LLF)和来自全连接层的高级特征(ULF),提升视频表征能力。
- 构建一种无监督度量学习框架,无需标注数据即可增强视频之间的相似性度量。
- 提出一种基于k-近邻与Jaccard距离的高效重排序算法,融合两级特征的检索结果,提升检索准确率。
提出的方法
- 从最后一层全连接层输出中利用帧间差异提取关键帧,随后通过时间相关性剪枝减少冗余。
- 提取多级视频特征:来自中间卷积层的低级特征(LLF)和来自最终全连接层(如fc7或pool5)的高级特征(ULF)。
- 通过稀疏上下文激活与Jaccard距离进行无监督度量学习,计算查询视频与候选视频之间的相似度。
- 为每个查询构建两个稀疏上下文激活向量:MIN(F_q^fc, F_q^conv) 用于正样本集,MAX(F_q^fc, F_q^conv) 用于负样本集。
- 采用改进的随机投影kd-Tree,在高维特征空间中实现快速k-近邻检索。
- 在LLF与ULF的k-近邻结果基础上,利用Jaccard距离进行排序融合,提升最终检索排序性能。
实验结果
研究问题
- RQ1与单一层次特征使用相比,融合预训练CNN多层特征是否能提升近似重复视频检索性能?
- RQ2在无标注数据条件下,利用稀疏上下文激活与Jaccard距离的无监督度量学习在视频相似性度量方面效果如何?
- RQ3所提出的基于k-近邻融合的重排序策略在多大程度上提升了检索准确率,相较于基线方法?
- RQ4在CC_WEB_VIDEO基准上,所提方法与SOTA NDVR方法相比,在mAP与精确率-召回率性能方面表现如何?
主要发现
- 所提出的CNN-UML方法在CC_WEB_VIDEO数据集上实现了0.9790的平均平均精度(mAP),优于所有对比的SOTA方法。
- 基于GoogLeNet的特征与排序融合(RankF)取得最高mAP(0.9790),证明了多级特征融合的有效性。
- 在所有CNN架构中,来自中间层的低级特征(LLF)略优于来自全连接层的高级特征(ULF)。
- 基于k-近邻与Jaccard距离的重排序策略显著提升了检索性能,尤其在融合LLF与ULF表征时效果更明显。
- 该方法无需复杂训练或词袋生成,相较于先前方法如CNN-L或MFH,表现出更优性能。
- PR曲线分析表明,所提方法在不同召回率水平下均保持高精确率,表明其具有鲁棒且一致的检索性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。