[论文解读] Ranking-based Deep Cross-modal Hashing
该论文提出了一种基于排序的深度跨模态哈希方法(RDCMH),通过将半监督语义排序与深度特征学习相结合,以提升跨模态检索性能。通过使用自适应三元组排序损失联合优化深度特征与哈希函数,RDCMH在多模态数据集上实现了最先进(SOTA)的性能表现,尤其在标签数量有限的弱监督设置下表现优异。
Cross-modal hashing has been receiving increasing interests for its low storage cost and fast query speed in multi-modal data retrievals. However, most existing hashing methods are based on hand-crafted or raw level features of objects, which may not be optimally compatible with the coding process. Besides, these hashing methods are mainly designed to handle simple pairwise similarity. The complex multilevel ranking semantic structure of instances associated with multiple labels has not been well explored yet. In this paper, we propose a ranking-based deep cross-modal hashing approach (RDCMH). RDCMH firstly uses the feature and label information of data to derive a semi-supervised semantic ranking list. Next, to expand the semantic representation power of hand-crafted features, RDCMH integrates the semantic ranking information into deep cross-modal hashing and jointly optimizes the compatible parameters of deep feature representations and of hashing functions. Experiments on real multi-modal datasets show that RDCMH outperforms other competitive baselines and achieves the state-of-the-art performance in cross-modal retrieval applications.
研究动机与目标
- 解决现有跨模态哈希方法依赖成对相似性及原始/人工设计特征的局限性。
- 利用多标签数据中的复杂、多层次排序语义以提升检索效果。
- 通过半监督语义度量整合有标签和无标签数据,以增强哈希性能。
- 联合优化深度特征学习与哈希函数学习,以提升兼容性与表征能力。
- 降低对完整标签集的依赖,使方法在弱监督场景下更具鲁棒性。
提出的方法
- RDCMH利用特征和标签信息构建半监督语义排序列表,以捕捉多层次相似性。
- 提出一种自适应三元组排序损失,根据语义相似度为更相关的样本对分配更高权重。
- 通过统一目标函数,联合优化深度神经网络参数以实现特征提取与哈希函数学习。
- 使用受标签与特征共同指导的相似度矩阵 S 来引导排序列表构建,从而提升语义表征能力。
- 以端到端方式整合深度特征学习与哈希优化,增强特征与二进制码之间的兼容性。
- 使用标量超参数 λ 平衡训练过程中的量化损失与排序损失。
实验结果
研究问题
- RQ1能否通过捕捉多层次语义结构的基于排序的方法,使跨模态哈希超越成对相似性?
- RQ2当标签不完整时,如何有效利用无标签数据以提升哈希性能?
- RQ3联合优化深度特征与哈希码是否能带来比独立学习更高的检索准确率?
- RQ4所提方法对超参数选择(尤其是 λ)的敏感性如何?
- RQ5在存在缺失标签的弱监督设置下,该方法能否保持强性能?
主要发现
- RDCMH 在三个基准多模态数据集(Mirflickr、NUS-WIDE、Wiki)上实现了最先进性能,优于所有竞争基线方法。
- 在 Wiki 数据集上,RDCMH 的 MAP 值高于 SePH,证明其在跨模态检索中表现更优。
- 当 30% 的标签被遮蔽时,RDCMH 的平均 MAP 比第二好的方法(CDQ)高出 4%,显示出对标签稀缺的鲁棒性。
- 在仅 10% 标签可用的情况下,RDCMH 的 MAP 仅下降 70.2%,而第二好的方法(CHN)下降至 81.9%,证实其在弱监督场景下的有效性。
- 消融实验表明,采用自适应权重的 RDCMH-NW 显著优于使用均匀权重的 RDCMH-NW,证明了加权三元组排序的优势。
- RDCMH 显著优于不包含深度特征学习(RDCMH-ND)和不进行联合优化(RDCMH-NJ)的变体,证实了端到端联合学习的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。