[论文解读] Deep Hashing with Category Mask for Fast Video Retrieval
本文提出了一种带有类别掩码的端到端深度视频哈希框架(DVHCM),通过同时优化类别间多样性分类损失和类别内相似性成对损失,联合学习视频表征与二值码。其关键创新在于类别掩码机制,可针对每种类别过滤无效哈希位,显著提升了在UCF101和HMDB51数据集上的检索准确率,超越当前最先进方法。
This paper proposes an end-to-end deep hashing framework with category mask for fast video retrieval. We train our network in a supervised way by fully exploiting inter-class diversity and intra-class identity. Classification loss is optimized to maximize inter-class diversity, while intra-pair is introduced to learn representative intra-class identity. We investigate the binary bits distribution related to categories and find out that the effectiveness of binary bits is highly correlated with data categories, and some bits may degrade classification performance of some categories. We then design hash code generation scheme with category mask to filter out bits with negative contribution. Experimental results demonstrate the proposed method outperforms several state-of-the-arts under various evaluation metrics on public datasets.
研究动机与目标
- 解决大规模视频数据库中高效且准确的视频检索挑战。
- 通过联合优化类别间多样性与类别内身份一致性,改进深度视频哈希。
- 探究哈希位有效性与数据类别之间的相关性。
- 设计一种类别掩码机制,以过滤低贡献位,提升检索性能。
提出的方法
- 该框架采用端到端的深度神经网络,同时学习视频特征与二值码。
- 利用分类损失最大化类别间分离度,利用成对损失保留类别内相似性。
- 该方法分析哈希位在各类别中的分布,识别出对特定类别性能产生负面影响的位。
- 引入类别掩码机制,在码生成过程中动态抑制每种类别中贡献为负的位。
- 模型采用监督方式训练,结合分类损失与成对损失监督。
- 最终哈希码通过将学习到的类别掩码应用于原始二值码生成。
实验结果
研究问题
- RQ1不同视频类别中,单个哈希位的有效性如何变化?
- RQ2通过每种类别过滤低贡献位,能否提升视频检索准确率?
- RQ3类别内身份一致性和类别间多样性如何共同影响深度视频哈希性能?
- RQ4类别感知的位选择机制能否在视频检索中超越标准哈希方法?
主要发现
- 所提出的DVHCM方法在UCF101数据集上,512位时达到95.3%的mAP,比最佳基线方法(DNNH)高出16.1%。
- 在HMDB51数据集上,DVHCM在512位时达到67.2%的mAP,较最佳基线方法提升19.2%。
- 移除类别掩码导致性能显著下降,证实其在过滤无效位方面起着关键作用。
- 在两个数据集上,所有位长(64至512位)下,该方法均优于深度与非深度基线方法。
- 精确率-召回率曲线与精确率曲线一致显示,DVHCM在所有基线中表现最优,尤其在低比特长度下优势明显。
- 消融实验确认,成对损失可提升性能,尤其在短时视频中(特征相似度高)表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。