[论文解读] Zero shot hashing
本文提出了一种零样本哈希框架,仅使用文本描述作为辅助信号,为训练数据中未见的物体类别图像生成哈希码。通过将问题表述为无监督哈希,该方法在训练过程中无需标注样本即可实现对未知类别的高精度标签预测。
This paper provides a framework to hash images containing instances of unknown object classes. In many object recognition problems, we might have access to huge amount of data. It may so happen that even this huge data doesn't cover the objects belonging to classes that we see in our day to day life. Zero shot learning exploits auxiliary information (also called as signatures) in order to predict the labels corresponding to unknown classes. In this work, we attempt to generate the hash codes for images belonging to unseen classes, information of which is available only through the textual corpus. We formulate this as an unsupervised hashing formulation as the exact labels are not available for the instances of unseen classes. We show that the proposed solution is able to generate hash codes which can predict labels corresponding to unseen classes with appreciably good precision.
研究动机与目标
- 解决训练数据中不存在的未知物体类别图像哈希问题。
- 利用文本描述作为辅助信号,在哈希中实现零样本标签预测。
- 开发一种无监督哈希框架,为未见类别生成紧凑的二进制码。
- 仅使用语义信息即可实现对新物体类别图像的准确检索与分类。
提出的方法
- 由于未知类别缺乏标签,将零样本图像哈希问题表述为无监督学习问题。
- 使用文本嵌入作为签名来表示未见类别,并在共享嵌入空间中将其与图像特征对齐。
- 设计一种哈希损失函数,以在保持图像与文本嵌入语义相似性的同时,满足二进制码约束。
- 使用深度神经网络端到端优化联合嵌入与哈希函数。
- 采用对比学习策略,拉近语义相似的图像-文本对,推远不相似的对。
- 仅在已见类别上进行模型训练,通过纯文本描述实现对未见类别的推理。
实验结果
研究问题
- RQ1我们能否在训练过程中完全不使用标注样本的情况下,为未知物体类别图像生成有效的哈希码?
- RQ2仅使用文本描述时,基于已见类别训练的哈希模型在未见类别上的泛化能力如何?
- RQ3使用文本签名在多大程度上提升了哈希中零样本标签预测的精度?
- RQ4无监督哈希框架在零样本泛化中能否保持图像与文本表示之间的语义一致性?
主要发现
- 所提方法仅使用文本信息即可在预测未见物体类别标签方面取得显著良好的精度。
- 该框架通过利用来自文本的语义嵌入,成功为未知类别的图像生成了哈希码。
- 该方法的无监督特性使得无需为未见类别提供标注数据即可实现有效的零样本泛化。
- 该模型保持了图像与文本表示之间的语义相似性,这对准确的零样本预测至关重要。
- 实验结果表明,仅依靠文本签名即可引导生成针对新类别的有意义哈希码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。