[论文解读] Deep Saliency Hashing
本文提出了一种新型的监督深度哈希方法——深度显著性哈希(DSaH),通过联合优化策略,将注意力网络集成以自动突出细粒度图像中的判别性区域,同时学习保持语义的二值编码。DSaH在细粒度数据集上取得了最先进性能,在CUB Bird和Stanford Dogs-120数据集上相比最强基线方法DTQ性能提升约10%。
In recent years, hashing methods have been proved to be effective and efficient for the large-scale Web media search. However, the existing general hashing methods have limited discriminative power for describing fine-grained objects that share similar overall appearance but have subtle difference. To solve this problem, we for the first time introduce the attention mechanism to the learning of fine-grained hashing codes. Specifically, we propose a novel deep hashing model, named deep saliency hashing (DSaH), which automatically mines salient regions and learns semantic-preserving hashing codes simultaneously. DSaH is a two-step end-to-end model consisting of an attention network and a hashing network. Our loss function contains three basic components, including the semantic loss, the saliency loss, and the quantization loss. As the core of DSaH, the saliency loss guides the attention network to mine discriminative regions from pairs of images. We conduct extensive experiments on both fine-grained and general retrieval datasets for performance evaluation. Experimental results on fine-grained datasets, including Oxford Flowers-17, Stanford Dogs-120, and CUB Bird demonstrate that our DSaH performs the best for fine-grained retrieval task and beats the strongest competitor (DTQ) by approximately 10% on both Stanford Dogs-120 and CUB Bird. DSaH is also comparable to several state-of-the-art hashing methods on general datasets, including CIFAR-10 and NUS-WIDE.
研究动机与目标
- 解决外观相似但存在细微差异的细粒度物体难以区分的挑战。
- 在类别众多但样本数据稀少的低数据环境下,提升哈希码的判别能力,此类情况在细粒度数据集中十分典型。
- 将注意力机制整合到深度哈希中,实现无需人工标注即可自动定位判别性局部区域。
- 构建一个端到端可训练的框架,联合优化显著性检测与语义保持哈希。
提出的方法
- 提出一种双流端到端深度学习框架:一个注意力网络用于生成显著性图,一个哈希网络用于学习二值编码。
- 采用全卷积网络作为注意力模块,生成与类别无关的显著性图,突出显示图像中的判别性区域。
- 设计一个多组件损失函数,结合语义损失(用于成对标签一致性)、显著性损失(用于图像四元组以强调判别性区域)和量化损失(用于学习最优二值编码)。
- 通过反向传播交替训练注意力网络与哈希网络,实现显著性检测与哈希码生成的联合优化。
- 使用VGG-16作为哈希网络的主干网络,以提取深层特征并生成紧凑的二值编码。
- 采用软到硬量化策略,弥合连续特征图与离散二值编码之间的差距。
实验结果
研究问题
- RQ1注意力机制能否提升细粒度图像检索中哈希码的判别能力?
- RQ2基于显著性的区域挖掘如何影响深度哈希模型在细粒度数据集上的性能?
- RQ3在注意力与哈希的联合学习中,语义损失、显著性损失与量化损失的最优组合是什么?
- RQ4所提出方法是否能泛化到CIFAR-10和NUS-WIDE等通用检索数据集?
- RQ5注意力网络对物体姿态变化、遮挡以及背景复杂度变化的鲁棒性如何?
主要发现
- 在Stanford Dogs-120数据集上,DSaH使用48位编码实现了0.6452的平均精度均值(mAP),相比最强基线方法DTQ性能提升约10%。
- 在CUB Bird数据集上,DSaH使用48位编码实现了0.6355的mAP,显著超越DTQ及其他最先进方法。
- 与仅使用语义损失相比,显著性损失组件在训练注意力网络时更具有效性,因其可直接引导判别性区域的定位。
- 当注意力网络同时使用语义损失与显著性损失,而哈希网络仅使用语义损失时,性能达到最佳,可避免原始图像编码质量下降。
- 注意力网络在各种条件下(包括遮挡、复杂背景、不同物体尺度与姿态)均能稳定突出狗的头部区域。
- 模型收敛迅速,仅经过几个训练周期后,注意力网络与哈希网络均趋于稳定,表明训练动态高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。