[论文解读] Zero-Shot Sketch-Image Hashing
本文提出零样本草图-图像哈希(ZSIH),这是首个面向零样本条件下高效大规模草图图像检索的端到端深度学习模型。该模型采用三流网络架构,结合克罗内克融合、图卷积与生成式哈希技术,有效缓解模态异构性,并实现从已见类别到未见类别的语义知识迁移,在零样本评估协议下于Sketchy和TU-Berlin数据集上达到最先进性能。
Recent studies show that large-scale sketch-based image retrieval (SBIR) can be efficiently tackled by cross-modal binary representation learning methods, where Hamming distance matching significantly speeds up the process of similarity search. Providing training and test data subjected to a fixed set of pre-defined categories, the cutting-edge SBIR and cross-modal hashing works obtain acceptable retrieval performance. However, most of the existing methods fail when the categories of query sketches have never been seen during training. In this paper, the above problem is briefed as a novel but realistic zero-shot SBIR hashing task. We elaborate the challenges of this special task and accordingly propose a zero-shot sketch-image hashing (ZSIH) model. An end-to-end three-network architecture is built, two of which are treated as the binary encoders. The third network mitigates the sketch-image heterogeneity and enhances the semantic relations among data by utilizing the Kronecker fusion layer and graph convolution, respectively. As an important part of ZSIH, we formulate a generative hashing scheme in reconstructing semantic knowledge representations for zero-shot retrieval. To the best of our knowledge, ZSIH is the first zero-shot hashing work suitable for SBIR and cross-modal search. Comprehensive experiments are conducted on two extended datasets, i.e., Sketchy and TU-Berlin with a novel zero-shot train-test split. The proposed model remarkably outperforms related works.
研究动机与目标
- 解决草图图像检索(SBIR)中的关键问题:当查询草图属于训练阶段未见类别时,模型性能下降。
- 构建一种跨模态哈希框架,在保持二进制码高效检索的同时,实现对未见类别的泛化能力。
- 通过注意力特征融合与语义知识迁移,缓解草图与图像之间的模态异构性。
- 设计一种可微分、端到端可训练的模型,支持零样本泛化,且无需未见类别标注数据。
- 通过结合高效的汉明距离匹配与对未见概念的语义泛化,实现实际的大规模检索应用。
提出的方法
- 采用端到端的三流网络架构:两个编码器分别用于草图与图像的二进制码生成,第三个网络用于语义知识融合。
- 利用带有注意力机制的克罗内克融合层,有效融合草图与图像特征,同时降低模态差异。
- 引入图卷积网络(GCNs),通过从词嵌入构建语义图,建模已见与未见类别之间的语义关系。
- 实施生成式哈希方案,从学习到的二进制码重建语义表示,实现可反向传播的知识迁移至未见类别。
- 应用比特正则化与去相关损失,提升二进制码质量并减少冗余。
- 使用一种新颖的零样本训练-测试划分策略进行模型训练,确保测试类别完全排除在训练集之外,模拟真实部署场景。
实验结果
研究问题
- RQ1深度哈希模型是否能在推理阶段无任何未见类别标注样本的情况下,泛化到未见的草图与图像类别?
- RQ2如何有效缓解草图与图像之间的模态异构性,以支持共享二进制表示学习?
- RQ3语义图构建在零样本哈希中,对从已见类别向未见类别迁移知识起到何种作用?
- RQ4生成式哈希在二进制码学习中如何促进语义知识重建与零样本泛化?
- RQ5在跨模态草图-图像哈希中,克罗内克融合相比传统特征融合方法是否具有显著优势?
主要发现
- 在零样本评估下,ZSIH在Sketchy和TU-Berlin数据集上的平均平均精度(mAP)显著优于现有方法,其中Sketchy数据集64位mAP达68.7%,TU-Berlin数据集达61.2%。
- 消融实验表明,克罗内克融合优于特征拼接与MFB方法,平均提升mAP超过5%。
- 移除图卷积层后,mAP下降约4%,证明其在建模类别间语义关系中的关键作用。
- 用比特正则化替代随机神经元导致训练不稳定与过拟合,凸显所提可微分哈希机制的重要性。
- 即使减少已见类别数量,模型仍保持强性能,展现出良好的鲁棒性与泛化能力。
- ZSIH是首个在端到端、可微分框架中成功结合零样本学习、跨模态哈希与草图图像检索的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。