[论文解读] Heterogeneous Contrastive Learning: Encoding Spatial Information for Compact Visual Representations
本文提出异构对比学习(Heterogeneous Contrastive Learning, HCL),一种通过双分支架构联合编码语义与空间特征,以增强自监督视觉表征学习的方法。通过在改进的特征金字塔网络分支中引入空间信息,HCL 提升了表征效率,在实例判别任务中实现更高准确率,并在目标检测与分割等下游任务中超越 MoCo-v2,同时将预训练成本减半。
Contrastive learning has achieved great success in self-supervised visual representation learning, but existing approaches mostly ignored spatial information which is often crucial for visual representation. This paper presents heterogeneous contrastive learning (HCL), an effective approach that adds spatial information to the encoding stage to alleviate the learning inconsistency between the contrastive objective and strong data augmentation operations. We demonstrate the effectiveness of HCL by showing that (i) it achieves higher accuracy in instance discrimination and (ii) it surpasses existing pre-training methods in a series of downstream tasks while shrinking the pre-training costs by half. More importantly, we show that our approach achieves higher efficiency in visual representations, and thus delivers a key message to inspire the future research of self-supervised visual representation learning.
研究动机与目标
- 解决对比学习目标与空间敏感数据增强(如裁剪和翻转)之间的不一致性问题。
- 通过联合编码空间结构与语义特征,提升视觉表征的效率与紧凑性。
- 在不牺牲性能的前提下降低预训练成本,尤其在需要空间理解的任务中。
- 证明异构特征编码相比同构方法能生成更高效、更低损失的表征。
提出的方法
- HCL 引入双分支编码器:一个分支从最终的全局平均池化层提取语义特征,另一分支使用改进的特征金字塔网络(FPN)提取空间特征。
- 空间分支被调整为输出 14×14 特征图,再通过全局池化生成紧凑向量,确保与语义向量在维度上兼容。
- 语义特征与空间特征在归一化后拼接,再输入对比损失函数,实现联合优化。
- 该方法仅在预训练阶段应用;最终模型仍与标准下游任务兼容,无需架构修改。
- 训练流程分为两个阶段:先单独预训练语义分支,再联合微调两个分支,以减少学习目标之间的冲突。
- 训练期间禁用水平翻转,以避免翻转图像与原始图像在空间特征上不匹配,从而提升下游性能。
实验结果
研究问题
- RQ1在对比学习预训练过程中编码空间信息,能否提升视觉表征的质量与效率?
- RQ2空间与语义特征的融合如何影响目标检测与实例分割等下游任务的性能?
- RQ3HCL 是否能缓解由裁剪和翻转等空间敏感数据增强带来的学习不一致性?
- RQ4在保持或提升性能的前提下,预训练成本能降低到何种程度?
- RQ5在表征紧凑性与实例判别准确率方面,语义与空间特征的联合使用是否更具效率?
主要发现
- 尽管仅使用 MoCo-v2 一半的预训练周期,HCL 在 MS-COCO 目标检测任务中实现 0.8% 的更高 AP,在实例分割任务中实现 0.7% 的更高 AP。
- 在总训练周期为 400 个周期(每阶段 200 个周期)的情况下,HCL 超越了 MoCo-v2 的 800 个周期训练,展现出显著的效率提升。
- 基于 PCA 的压缩实验表明,混合 128D 特征(半语义、半空间)的实例判别准确率高于同等维度的纯语义特征。
- 训练期间禁用水平翻转可使检测任务性能提升 0.4%,LVIS 实例分割任务性能提升 0.5%,表明空间与语义学习之间的冲突减少。
- 空间分支采用改进的 FPN 设计,通过直接输出 14×14 特征图,避免额外下采样,将训练成本降低约 10%。
- 两阶段训练流程表明,语义预训练至关重要;若跳过该阶段,检测与分割任务的 AP 均下降 0.5%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。