[论文解读] Coupled CycleGAN: Unsupervised Hashing Network for Cross-Modal Retrieval
该论文提出UCH,一种无监督耦合循环生成对抗网络框架,无需标注数据即可联合学习共享表征与可靠的哈希码,用于跨模态检索。通过整合外循环生成对抗网络进行表征学习,以及内循环生成对抗网络进行哈希码生成,UCH实现端到端优化,在MIRFlickr25k、IAPR TC-12和COCO数据集上达到最先进性能,64位哈希码长度下MAP得分最高达0.679。
In recent years, hashing has attracted more and more attention owing to its superior capacity of low storage cost and high query efficiency in large-scale cross-modal retrieval. Benefiting from deep leaning, continuously compelling results in cross-modal retrieval community have been achieved. However, existing deep cross-modal hashing methods either rely on amounts of labeled information or have no ability to learn an accuracy correlation between different modalities. In this paper, we proposed Unsupervised coupled Cycle generative adversarial Hashing networks (UCH), for cross-modal retrieval, where outer-cycle network is used to learn powerful common representation, and inner-cycle network is explained to generate reliable hash codes. Specifically, our proposed UCH seamlessly couples these two networks with generative adversarial mechanism, which can be optimized simultaneously to learn representation and hash codes. Extensive experiments on three popular benchmark datasets show that the proposed UCH outperforms the state-of-the-art unsupervised cross-modal hashing methods.
研究动机与目标
- 为解决现有无监督跨模态哈希方法分别学习表征与哈希码所导致的相关性学习次优的问题。
- 通过实现共享表征与紧凑二进制码的端到端学习,消除跨模态检索中对昂贵标注数据的依赖。
- 通过双循环生成对抗网络架构,耦合表征学习与哈希码生成,提升检索准确率。
- 通过统一框架中表征学习与哈希学习的相互优化,实现两者性能的最优化。
- 在无监督设置下,于标准基准数据集上展示卓越性能。
提出的方法
- 该框架采用外循环生成对抗网络,包含图像与文本编码器(E^I, E^T)、生成器(G^{I→T}_f, G^{T→I}_f)和判别器(D^I_f, D^T_f),用于学习共享的、模态不变的表征。
- 内循环生成对抗网络由生成器(G^{I→T}_z, G^{T→I}_z)与判别器(D^T_z, D^I_z)组成,用于从共享表征中生成可靠的二进制哈希码。
- 通过生成对抗机制联合优化两个循环网络,实现表征学习与哈希码生成的端到端训练,实现同步优化。
- 模型使用类似三元组的损失函数,在训练过程中保留图像-文本对之间的语义相似性,即使无显式标签亦可实现。
- 网络采用两层全连接层(例如,256→128→32)进行特征提取与哈希码生成,图像学习率为10⁻⁴,文本学习率为10⁻²。
- 框架以批量大小128与权重衰减10⁻¹进行训练,并使用平均平均精度(MAP)与Precision@1000评估性能。
实验结果
研究问题
- RQ1是否能够通过统一的深度学习框架,在无需标注数据的情况下,联合优化跨模态检索中的表征学习与哈希码生成?
- RQ2将两个循环生成对抗网络(外循环用于表征,内循环用于哈希)进行耦合,相比解耦方法,如何提升检索准确率?
- RQ3所提方法在标准基准数据集上,相较于现有无监督跨模态哈希方法,性能提升程度如何?
- RQ4通过双向生成实现模态相关性的迭代对抗学习,是否能生成更准确、更鲁棒的哈希码?
- RQ5该模型在不同哈希码长度与不同检索任务(图像到文本与文本到图像)下的表现如何?
主要发现
- UCH在MIRFlickr25k、IAPR TC-12与Microsoft COCO数据集上,所有哈希码长度(16、32、64位)下均取得最高的平均平均精度(MAP)。
- 在MIRFlickr25k数据集上,UCH在64位哈希码长度下取得0.679的MAP,显著优于UGACH(0.616)及其他当前最先进无监督方法。
- 在IAPR TC-12数据集上,UCH在64位哈希码长度下取得0.488的MAP,超越UGACH(0.480)及其他竞争方法。
- Precision@1000曲线显示,UCH在所有数据集与所有哈希码长度下,均保持高于所有基线方法的精度。
- PR曲线表明,UCH在从0到64的所有汉明半径值下,均实现更优的检索性能。
- 消融实验表明,耦合循环设计通过实现相互优化,显著提升了表征质量与哈希码可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。