[论文解读] Attribute-Guided Network for Cross-Modal Zero-Shot Hashing
本文提出属性引导网络(AgNet),一种用于跨模态零样本哈希(CMZSH)的深度神经网络,通过将视觉与文本特征对齐至共享属性空间,以弥合模态异构性并实现零样本检索。AgNet 利用类别级属性指导哈希码生成,在 AwA、SUN 和 ImageNet 数据集上均实现了图像检索与文本检索的最先进性能。
Zero-Shot Hashing aims at learning a hashing model that is trained only by instances from seen categories but can generate well to those of unseen categories. Typically, it is achieved by utilizing a semantic embedding space to transfer knowledge from seen domain to unseen domain. Existing efforts mainly focus on single-modal retrieval task, especially Image-Based Image Retrieval (IBIR). However, as a highlighted research topic in the field of hashing, cross-modal retrieval is more common in real world applications. To address the Cross-Modal Zero-Shot Hashing (CMZSH) retrieval task, we propose a novel Attribute-Guided Network (AgNet), which can perform not only IBIR, but also Text-Based Image Retrieval (TBIR). In particular, AgNet aligns different modal data into a semantically rich attribute space, which bridges the gap caused by modality heterogeneity and zero-shot setting. We also design an effective strategy that exploits the attribute to guide the generation of hash codes for image and text within the same network. Extensive experimental results on three benchmark datasets (AwA, SUN, and ImageNet) demonstrate the superiority of AgNet on both cross-modal and single-modal zero-shot image retrieval tasks.
研究动机与目标
- 为解决现有零样本哈希方法仅关注单模态(图像)检索的局限性,特别是在现实世界中的跨模态场景(如基于文本的图像检索)中。
- 弥合零样本设定下由模态异构性和类别迁移引起的语义鸿沟。
- 保留高维特征与其低维二值哈希码之间的语义相似性。
- 开发一个统一框架,支持在零样本条件下同时实现基于图像的图像检索(IBIR)与基于文本的图像检索(TBIR)。
- 利用类别级属性作为共享语义空间,对齐视觉与文本模态并指导哈希码生成。
提出的方法
- AgNet 将视觉与文本特征映射到一个语义丰富的共享属性空间,以减少模态差异并支持零样本泛化。
- 网络采用共享的深度神经架构,为两种模态生成二值哈希码,由预测的属性向量引导。
- 采用多任务学习策略,联合优化属性预测与哈希码学习,确保语义一致性。
- 模型使用直通估计器反向传播通过哈希码生成中的硬阈值操作。
- 损失函数结合三元组损失以保持语义相似性,以及基于边距的排序损失,以强制正确排序相似与不相似样本。
- 使用正例误差距离(PED)评估属性预测准确性,仅关注正例属性标签以评估判别性能。
实验结果
研究问题
- RQ1统一的深度学习框架是否能有效支持零样本设定下的基于图像的图像检索(IBIR)与基于文本的图像检索(TBIR)?
- RQ2在零样本哈希中,如何缓解图像与文本之间的模态异构性?
- RQ3将类别级属性作为共享语义空间在多大程度上提升了零样本检索性能?
- RQ4属性预测准确性在多大程度上影响模型在未见类别上的整体哈希性能?
- RQ5学习到的哈希码是否能在低维二值空间中保持原始高维特征的语义相似性?
主要发现
- AgNet 在三个基准数据集(AwA、SUN 和 ImageNet)上,均实现了跨模态与单模态零样本图像检索任务的最先进性能。
- 在 AwA 数据集上,AgNet 在 TBIR 上达到 85.6% 的平均精度(mAP),在 IBIR 上达到 82.3%,优于先前的最先进方法。
- 在 SUN 数据集上,AgNet 在 TBIR 上达到 72.1% 的 mAP,在 IBIR 上达到 69.8%,尽管属性预测准确率较低,仍表现出强鲁棒性。
- 正例误差距离(PED)分析表明,AwA 上的属性预测比在 SUN 上更准确,这与 AgNet 在 AwA 上表现更优的结果一致。
- t-SNE 可视化结果证实,属性空间中的语义关系在学习到的哈希空间中得到良好保留,验证了嵌入映射的有效性。
- 混淆矩阵分析显示,尽管大多数视觉实例能正确匹配到其对应的文本实例,但在语义相近类别(如海豹与座头鲸)之间仍存在部分混淆,表明此类情况下仍需改进消歧能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。