[论文解读] Transitive Hashing Network for Heterogeneous Multimedia Retrieval
本文提出了一种可传递哈希网络(Transitive Hashing Network, THN),用于跨模态和跨域多媒体检索,利用带有模态关系的辅助数据集来学习可传递的哈希码。通过在端到端深度架构中联合优化跨模态相关性学习与域分布对齐,THN 在 NUS-WIDE 和 ImageNet-YahooQA 数据集上实现了最先进性能,平均平均精度(MAP)显著优于先前方法。
Hashing has been widely applied to large-scale multimedia retrieval due to the storage and retrieval efficiency. Cross-modal hashing enables efficient retrieval from database of one modality in response to a query of another modality. Existing work on cross-modal hashing assumes heterogeneous relationship across modalities for hash function learning. In this paper, we relax the strong assumption by only requiring such heterogeneous relationship in an auxiliary dataset different from the query/database domain. We craft a hybrid deep architecture to simultaneously learn the cross-modal correlation from the auxiliary dataset, and align the dataset distributions between the auxiliary dataset and the query/database domain, which generates transitive hash codes for heterogeneous multimedia retrieval. Extensive experiments exhibit that the proposed approach yields state of the art multimedia retrieval performance on public datasets, i.e. NUS-WIDE, ImageNet-YahooQA.
研究动机与目标
- 解决当查询与数据库模态之间缺乏直接关联时,跨模态多媒体检索的挑战。
- 通过利用具有已知图像-文本关系的辅助数据集,学习可传递关系,实现在不同数据分布(如 ImageNet 和 YahooQA)之间的有效检索。
- 通过端到端的分布对齐方法,克服辅助数据集与目标数据集之间的域偏移问题。
- 构建一个统一的深度学习框架,联合学习跨模态相关性并最小化量化误差,以生成紧凑的二值化哈希码。
提出的方法
- 设计一种混合深度神经网络,整合来自辅助数据集(如包含图像-文本对的 Flickr 类数据)的异质关系学习。
- 引入基于最大均值差异(MMD)的同质分布对齐模块,以减少辅助数据集与目标查询/数据库域之间的域偏移。
- 使用多组件损失函数进行端到端训练:成对交叉熵损失用于模态相关性学习,MMD 损失用于分布对齐,成对量化损失用于最小化二值化误差。
- 采用深度卷积网络进行图像表征,使用多层感知机进行文本表征,以实现跨模态的有效特征学习。
- 通过可传递对齐生成保留模态间与域间语义相似性的紧凑二值化哈希码。
- 使用包含相关性、对齐与量化目标的复合损失函数,通过反向传播优化整个架构。
实验结果
研究问题
- RQ1当缺乏查询与数据库模态之间的直接跨模态链接时,深度哈希模型是否能够学习到它们之间的可传递关系?
- RQ2具有已知图像-文本关系的辅助数据集在实现跨域检索方面有多高效?
- RQ3在连接来自不同域的数据集时,域分布对齐在多大程度上提升了检索性能?
- RQ4各组件(相关性学习、分布对齐、量化损失)对整体检索性能的相对贡献如何?
主要发现
- THN 在 NUS-WIDE 和 ImageNet-YahooQA 两个数据集上均实现了最先进性能,显著优于现有方法,包括 DCMH。
- 在 ImageNet-YahooQA 上,与 DCMH 相比,THN 在图像到文本检索和文本到图像检索中的平均平均精度(MAP)分别提升了 5.03% 和 6.91%。
- 消融研究证实,相关性学习的成对交叉熵损失相比内积损失(THN-ip)可带来超过 24% 的绝对 MAP 提升。
- 移除无监督训练数据(THN-D)导致 MAP 下降 4.06% 至 6.09%,证明了利用未标记数据进行域适应的价值。
- 若不包含量化损失(THN-Q),MAP 分别下降 5.83% 和 4.20%,证实其在最小化二值化误差中的关键作用。
- 精确率-召回率曲线显示,THN 在 24 位哈希码下在所有召回水平上均保持最高精确率,验证了其在不同检索阈值下的鲁棒性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。