[论文解读] CIMON: Towards High-quality Hash Codes
CIMON 提出了一种新颖的无监督哈希方法,通过结合全局优化与置信度感知的相似性加权,实现可靠的语义引导,同时引入双致性学习框架(语义一致性和对比一致性),以提升模型的鲁棒性与判别能力。该方法在基准数据集上实现了最先进性能,检索准确率更高,且对扰动具有更强的不变性。
Recently, hashing is widely used in approximate nearest neighbor search for its storage and computational efficiency. Most of the unsupervised hashing methods learn to map images into semantic similarity-preserving hash codes by constructing local semantic similarity structure from the pre-trained model as the guiding information, i.e., treating each point pair similar if their distance is small in feature space. However, due to the inefficient representation ability of the pre-trained model, many false positives and negatives in local semantic similarity will be introduced and lead to error propagation during the hash code learning. Moreover, few of the methods consider the robustness of models, which will cause instability of hash codes to disturbance. In this paper, we propose a new method named { extbf{C}}omprehensive s{ extbf{I}}milarity { extbf{M}}ining and c{ extbf{O}}nsistency lear{ extbf{N}}ing (CIMON). First, we use global refinement and similarity statistical distribution to obtain reliable and smooth guidance. Second, both semantic and contrastive consistency learning are introduced to derive both disturb-invariant and discriminative hash codes. Extensive experiments on several benchmark datasets show that the proposed method outperforms a wide range of state-of-the-art methods in both retrieval performance and robustness.
研究动机与目标
- 为解决使用表示能力有限的预训练模型时,无监督哈希中噪声大且不可靠的局部相似性结构问题。
- 通过优化相似性矩阵中的错误正例与负例,减少哈希码学习过程中的误差传播。
- 通过学习对扰动不变的哈希码,提升模型鲁棒性,使其在图像变换或噪声下保持稳定。
- 通过联合语义与对比一致性学习,增强哈希码的判别能力。
- 实现高质量、均匀分布且信息丰富的二进制码,充分使用每一位的容量。
提出的方法
- CIMON 应用全局优化,校正不同类别边界点之间错误的相似性信号,提升初始相似性图的可靠性。
- 引入基于置信度的加权机制,利用相似性统计分布,降低不确定样本对的影响,平滑相似性矩阵。
- 通过数据增强为每张图像生成两个视图,实现在视图间并行与交叉的语义一致性学习。
- 设计一种新型一致性损失,强制实现语义一致性(增强视图的深层特征之间)与对比一致性(增强视图的哈希码之间)。
- 损失函数结合相似性保持与对比学习,生成具有判别力且鲁棒的哈希码。
- 采用混合损失函数,联合优化优化后的相似性引导与一致性学习目标,实现端到端训练。
实验结果
研究问题
- RQ1当使用表示能力有限的预训练模型时,如何提升无监督哈希中初始相似性结构的可靠性?
- RQ2置信度感知的相似性对加权在多大程度上能减少哈希码学习过程中的误差传播?
- RQ3联合语义与对比一致性学习是否能增强哈希码在图像扰动或变换下的鲁棒性?
- RQ4在检索准确率与噪声下稳定性方面,所提方法相较于最先进无监督哈希技术表现如何?
- RQ5所提方法是否实现了更优的位利用率与哈希码分布的均匀性?
主要发现
- 在 CIFAR-10 上,CIMON 在 128 位下达到 0.4981 的平均精度均值(mAP),显著优于最佳基线方法(0.4506),创下新 SOTA 记录。
- 在 NUS-WIDE 与 MS-COCO 上,CIMON 在所有位长下均达到最先进 mAP,展现出一致的优越性。
- 在查询图像中加入噪声后,CIMON 的 mAP 仅下降 0.012,而基线方法 MLS 3 RUDH 的 mAP 下降 0.048,表明其具有更优的鲁棒性。
- 在噪声下,CIMON 哈希码中变化的位数显著更少(平均约 1.5 位),远低于 MLS 3 RUDH(平均约 3.5 位),表明其具有更高的扰动不变性。
- CIMON 的哈希位分布近似均匀分布,证实了对全部位容量的有效利用与冗余的减少。
- 消融实验表明,每个组件——全局优化、置信度加权、语义一致性与对比一致性——均对性能有增量贡献,完整模型达到最佳效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。