[论文解读] Cross-Scale Context Extracted Hashing for Fine-Grained Image Binary Encoding
本论文提出了一种新型深度哈希框架——跨尺度上下文提取哈希网络(CSCE-Net),通过双分支结构结合注意力引导信息提取(AIE)模块,联合建模全局语义与局部细节,从而提升细粒度图像检索性能。该方法引入一种内容感知的动态符号函数(DSF),在二值编码过程中减少信息损失,在ImageNet100和MS COCO基准上达到最先进性能。
Deep hashing has been widely applied to large-scale image retrieval tasks owing to efficient computation and low storage cost by encoding high-dimensional image data into binary codes. Since binary codes do not contain as much information as float features, the essence of binary encoding is preserving the main context to guarantee retrieval quality. However, the existing hashing methods have great limitations on suppressing redundant background information and accurately encoding from Euclidean space to Hamming space by a simple sign function. In order to solve these problems, a Cross-Scale Context Extracted Hashing Network (CSCE-Net) is proposed in this paper. Firstly, we design a two-branch framework to capture fine-grained local information while maintaining high-level global semantic information. Besides, Attention guided Information Extraction module (AIE) is introduced between two branches, which suppresses areas of low context information cooperated with global sliding windows. Unlike previous methods, our CSCE-Net learns a content-related Dynamic Sign Function (DSF) to replace the original simple sign function. Therefore, the proposed CSCE-Net is context-sensitive and able to perform well on accurate image binary encoding. We further demonstrate that our CSCE-Net is superior to the existing hashing methods, which improves retrieval performance on standard benchmarks.
研究动机与目标
- 为解决现有哈希方法在二值编码过程中抑制冗余背景并保留关键语义内容的局限性。
- 通过增强汉明空间中的特征表示,提升对不明显目标和复杂背景的检索准确率。
- 减少从连续特征到二进制码转换过程中符号函数变换导致的信息损失。
- 开发一种上下文敏感、自适应的二值编码机制,同时保持码的平衡性与语义保真度。
提出的方法
- CSCE-Net采用双分支网络,同步提取全局语义特征与细粒度局部特征。
- 注意力引导信息提取(AIE)模块利用滑动窗口将局部特征与全局上下文对齐,以抑制低信息区域。
- AIE模块利用多尺度全局上下文对局部特征进行过滤与增强,聚焦于显著物体区域。
- 端到端学习一种动态符号函数(DSF)以替代标准符号函数,实现上下文感知的二值量化。
- 模型采用联合损失进行训练:CosFace用于度量学习,结合DSF的量化损失以保持类内紧凑性。
- 通过三元组对比损失与码平衡正则化相结合的方式优化框架。
实验结果
研究问题
- RQ1深度哈希模型如何在抑制冗余背景的同时,更好地在二进制码中保留关键语义内容?
- RQ2可学习的、内容自适应的符号函数是否能相比固定符号函数提升二值编码的准确性?
- RQ3基于注意力过滤的跨尺度特征融合在细粒度图像数据集上能在多大程度上提升检索性能?
- RQ4在低比特编码(如16位)下,所提方法是否仍能保持优越性能,此时信息损失最为关键?
主要发现
- 在ImageNet100上,CSCE-Net在16位、32位和64位编码下分别取得0.869、0.887和0.897的mAP,达到最先进水平。
- 在MS COCO上,模型在16位、32位和64位编码下分别达到0.807、0.852和0.888的mAP,优于先前方法。
- 与基线相比,AIE模块在16位编码下使ImageNet100的mAP提升3%,MS COCO的mAP提升7%。
- 动态符号函数(DSF)减少了信息损失,在mAP上相比标准量化损失提升0.007。
- CosFace损失与DSF的结合取得最佳性能,证实了度量学习与自适应量化相结合的有效性。
- 消融实验表明,AIE在mAP上相比简单拼接或单尺度滑动窗口方法提升1%–3%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。