[论文解读] Deep Binaries: Encoding Semantic-Rich Cues for Efficient Textual-Visual Cross Retrieval
本文提出文本-视觉深度二值化(TVDB),一种深度学习框架,将富含语义的图像区域和长描述性句子编码为紧凑的二进制码,以实现高效的跨模态检索。通过结合基于区域的卷积神经网络与LSTM处理图像,以及使用文本卷积神经网络处理句子,并采用随机小批量训练策略,TVDB在COCO、IAPR TC-12和INRIA Web Queries数据集上实现了最先进性能,显著优于现有的二值化哈希方法。
Cross-modal hashing is usually regarded as an effective technique for large-scale textual-visual cross retrieval, where data from different modalities are mapped into a shared Hamming space for matching. Most of the traditional textual-visual binary encoding methods only consider holistic image representations and fail to model descriptive sentences. This renders existing methods inappropriate to handle the rich semantics of informative cross-modal data for quality textual-visual search tasks. To address the problem of hashing cross-modal data with semantic-rich cues, in this paper, a novel integrated deep architecture is developed to effectively encode the detailed semantics of informative images and long descriptive sentences, named as Textual-Visual Deep Binaries (TVDB). In particular, region-based convolutional networks with long short-term memory units are introduced to fully explore image regional details while semantic cues of sentences are modeled by a text convolutional network. Additionally, we propose a stochastic batch-wise training routine, where high-quality binary codes and deep encoding functions are efficiently optimized in an alternating manner. Experiments are conducted on three multimedia datasets, i.e. Microsoft COCO, IAPR TC-12, and INRIA Web Queries, where the proposed TVDB model significantly outperforms state-of-the-art binary coding methods in the task of cross-modal retrieval.
研究动机与目标
- 为解决现有跨模态哈希方法依赖整体图像表征和粗粒度文本特征的局限性,这些方法无法捕捉详细语义。
- 建模来自图像区域和长描述性句子的丰富语义线索,以提升跨模态检索性能。
- 开发一种高效的训练策略,以随机小批量方式交替优化二进制码和深度编码函数。
- 在保持大规模数据计算效率的同时,实现高检索准确率并使用紧凑的二进制码。
提出的方法
- TVDB采用基于区域的卷积神经网络结合LSTM单元,以编码图像区域中的详细空间与语义信息。
- 使用文本卷积神经网络建模长描述性句子中词语之间的序列依赖关系与结构线索。
- 采用随机小批量训练流程,在每个小批量内交替优化二进制码与深度编码函数,以提升收敛性与泛化能力。
- 利用从训练数据中提取的相似性矩阵,通过迹最大化策略指导二进制码的优化。
- 通过可微松弛策略在训练过程中离散更新二进制码,以保持与反向传播的兼容性。
- 联合训练模型,以最小化预测与真实跨模态相似度在共享汉明空间中的差异。
实验结果
研究问题
- RQ1能否通过捕捉区域图像语义与句子级依赖关系的深度二值编码,提升跨模态检索性能?
- RQ2随机小批量训练策略是否相比按周期优化码的基线方法,能实现更快收敛与更好泛化?
- RQ3将基于区域的图像特征与文本卷积神经网络结合,与整体图像表征和词袋文本特征相比,在跨模态哈希中表现如何?
- RQ4所提方法在基准数据集上相比最先进二值哈希技术,性能提升程度如何?
主要发现
- TVDB在三个基准数据集(Microsoft COCO、IAPR TC-12和INRIA Web Queries)上实现了最先进平均平均精度(MAP),显著优于现有二值编码方法。
- 消融研究显示,若移除区域图像特征(TVDB-I1、TVDB-I2)或使用词袋模型处理文本(TVDB-T1),检索性能将显著下降。
- 将文本卷积神经网络替换为LSTM(TVDB-T2)的性能优于词袋模型,但仍逊于完整TVDB模型,证实了所提文本卷积神经网络架构的有效性。
- 随机小批量训练策略相比按周期学习码的基线方法(TVDB-E1、TVDB-E2),实现了更快收敛与更高峰值性能。
- TVDB-N在训练过程中固定二进制码,收敛迅速但性能显著较低,表明联合优化码与网络参数的必要性。
- 该模型使用128位码即可实现高检索准确率,top-5检索结果表明TVDB能正确检索出匹配复杂句子查询的图像,例如涉及多个对象(如'people'、'bike'和'street')的查询。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。