Skip to main content
QUICK REVIEW

[论文解读] CNN Retrieval based Unsupervised Metric Learning for Near-Duplicated Video Retrieval

Hao Cheng, Ping Wang|arXiv (Cornell University)|May 30, 2021
Advanced Image and Video Retrieval Techniques参考文献 13被引用 4
一句话总结

该论文提出了一种基于CNN的无监督度量学习框架,用于近似重复视频检索(NDVR),通过融合预训练网络的中间卷积层和全连接层的特征,结合无监督度量学习与基于k-近邻的重排序策略,在CC_WEB_VIDEO数据集上实现了0.9790的SOTA mAP。

ABSTRACT

As important data carriers, the drastically increasing number of multimedia videos often brings many duplicate and near-duplicate videos in the top results of search. Near-duplicate video retrieval (NDVR) can cluster and filter out the redundant contents. In this paper, the proposed NDVR approach extracts the frame-level video representation based on convolutional neural network (CNN) features from fully-connected layer and aggregated intermediate convolutional layers. Unsupervised metric learning is used for similarity measurement and feature matching. An efficient re-ranking algorithm combined with k-nearest neighborhood fuses the retrieval results from two levels of features and further improves the retrieval performance. Extensive experiments on the widely used CC\_WEB\_VIDEO dataset shows that the proposed approach exhibits superior performance over the state-of-the-art.

研究动机与目标

  • 解决大规模高冗余视频数据集中近似重复视频检索的挑战。
  • 通过融合来自中间卷积层的低级特征(LLF)和来自全连接层的高级特征(ULF),提升视频表征能力。
  • 构建一种无监督度量学习框架,无需标注数据即可增强视频之间的相似性度量。
  • 提出一种基于k-近邻与Jaccard距离的高效重排序算法,融合两级特征的检索结果,提升检索准确率。

提出的方法

  • 从最后一层全连接层输出中利用帧间差异提取关键帧,随后通过时间相关性剪枝减少冗余。
  • 提取多级视频特征:来自中间卷积层的低级特征(LLF)和来自最终全连接层(如fc7或pool5)的高级特征(ULF)。
  • 通过稀疏上下文激活与Jaccard距离进行无监督度量学习,计算查询视频与候选视频之间的相似度。
  • 为每个查询构建两个稀疏上下文激活向量:MIN(F_q^fc, F_q^conv) 用于正样本集,MAX(F_q^fc, F_q^conv) 用于负样本集。
  • 采用改进的随机投影kd-Tree,在高维特征空间中实现快速k-近邻检索。
  • 在LLF与ULF的k-近邻结果基础上,利用Jaccard距离进行排序融合,提升最终检索排序性能。

实验结果

研究问题

  • RQ1与单一层次特征使用相比,融合预训练CNN多层特征是否能提升近似重复视频检索性能?
  • RQ2在无标注数据条件下,利用稀疏上下文激活与Jaccard距离的无监督度量学习在视频相似性度量方面效果如何?
  • RQ3所提出的基于k-近邻融合的重排序策略在多大程度上提升了检索准确率,相较于基线方法?
  • RQ4在CC_WEB_VIDEO基准上,所提方法与SOTA NDVR方法相比,在mAP与精确率-召回率性能方面表现如何?

主要发现

  • 所提出的CNN-UML方法在CC_WEB_VIDEO数据集上实现了0.9790的平均平均精度(mAP),优于所有对比的SOTA方法。
  • 基于GoogLeNet的特征与排序融合(RankF)取得最高mAP(0.9790),证明了多级特征融合的有效性。
  • 在所有CNN架构中,来自中间层的低级特征(LLF)略优于来自全连接层的高级特征(ULF)。
  • 基于k-近邻与Jaccard距离的重排序策略显著提升了检索性能,尤其在融合LLF与ULF表征时效果更明显。
  • 该方法无需复杂训练或词袋生成,相较于先前方法如CNN-L或MFH,表现出更优性能。
  • PR曲线分析表明,所提方法在不同召回率水平下均保持高精确率,表明其具有鲁棒且一致的检索性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。