[论文解读] Hallucination Improves the Performance of Unsupervised Visual Representation Learning
本文提出 Hallucinator,一种可微分的即插即用模块,通过在特征空间中生成合成正样本,以增强自监督视觉表征学习中的对比学习。通过应用非对称特征外推和非线性幻觉机制,该方法提升了特征方差与模型鲁棒性,在 CIFAR-10/100、Tiny ImageNet、STL-10 和 ImageNet 上的线性评估以及下游检测/分割任务中,实现了 0.3% 至 3.0% 的一致准确率提升。
Contrastive learning models based on Siamese structure have demonstrated remarkable performance in self-supervised learning. Such a success of contrastive learning relies on two conditions, a sufficient number of positive pairs and adequate variations between them. If the conditions are not met, these frameworks will lack semantic contrast and be fragile on overfitting. To address these two issues, we propose Hallucinator that could efficiently generate additional positive samples for further contrast. The Hallucinator is differentiable and creates new data in the feature space. Thus, it is optimized directly with the pre-training task and introduces nearly negligible computation. Moreover, we reduce the mutual information of hallucinated pairs and smooth them through non-linear operations. This process helps avoid over-confident contrastive learning models during the training and achieves more transformation-invariant feature embeddings. Remarkably, we empirically prove that the proposed Hallucinator generalizes well to various contrastive learning models, including MoCoV1&V2, SimCLR and SimSiam. Under the linear classification protocol, a stable accuracy gain is achieved, ranging from 0.3% to 3.0% on CIFAR10&100, Tiny ImageNet, STL-10 and ImageNet. The improvement is also observed in transferring pre-train encoders to the downstream tasks, including object detection and segmentation.
研究动机与目标
- 为解决对比学习在自监督视觉表征学习中的局限性,特别是正样本对多样性不足以及因方差过低导致的过拟合问题。
- 克服图像级数据增强和生成式幻觉方法带来的计算负担与次优性能。
- 开发一种轻量级、可微分模块,在不增加训练计算成本或超参数调优的前提下,增强对比学习。
- 通过在特征空间中生成语义有意义、对变换具有鲁棒性的正样本对,提升特征泛化性与不变性。
- 在 MoCoV2、SimCLR 和 SimSiam 等多种最先进对比学习框架中,展示其广泛兼容性与一致的性能增益。
提出的方法
- Hallucinator 插入孪生对比学习框架的编码器之后,直接在特征空间中生成额外的正样本。
- 采用非对称特征外推方法,增加正样本对之间的方差,降低互信息,避免产生平凡的对比信号。
- 对扩展后的特征应用非线性幻觉过程,引入平滑、与任务相关的变换,且该过程可微分并可训练。
- 幻觉生成的特征与主对比学习目标端到端联合优化,实现无需额外推理成本的联合训练。
- 该方法仅依赖正样本,因此可作为即插即用模块,兼容任意基于孪生结构的对比学习模型。
- 在其中一个分支中使用中心裁剪,以防止虚假正样本出现,并在幻觉过程中保持语义一致性。
实验结果
研究问题
- RQ1在特征空间中生成合成正样本是否能提升对比自监督学习模型的性能?
- RQ2在特征空间中采用可微分的非线性幻觉过程,是否能比传统数据增强方法带来更好的特征不变性与泛化能力?
- RQ3非对称特征外推与对称方法相比,在降低正样本对之间互信息方面表现如何?
- RQ4所提出的 Hallucinator 是否能有效泛化至多种对比学习框架(如 MoCoV2、SimCLR 和 SimSiam)?
- RQ5幻觉表示在多大程度上提升了下游任务(如目标检测与实例分割)的可迁移性?
主要发现
- 在包括 CIFAR-10/100、Tiny ImageNet、STL-10 和 ImageNet 在内的多个基准上,Hallucinator 在线性分类协议下实现了 0.3% 至 3.0% 的稳定准确率增益。
- 该方法显著提升了下游任务的迁移性能:在 PASCAL VOC 上的目标检测任务中准确率提升 0.3% 至 0.8%,COCO 上的目标检测与实例分割任务也表现出一致的性能提升。
- 最优配置采用幻觉头中三个非线性层,且非对称外推中 β₁=0.0、β₂=1.0,可获得最佳性能。
- 使用 p=0.5 至 0.6 的中心裁剪比例可有效保留语义内容并减少虚假正样本,从而提升幻觉质量。
- 消融实验证实,非对称外推与非线性幻觉均不可或缺,任一移除均导致性能下降。
- 该方法在多种对比学习模型(包括 MoCoV1/V2、SimCLR 和 SimSiam)上均表现出良好泛化能力,且无需针对特定模型进行调优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。