Skip to main content
QUICK REVIEW

[论文解读] Masked Siamese ConvNets

Jing Li, Jiachen Zhu|arXiv (Cornell University)|Jun 15, 2022
Domain Adaptation and Few-Shot Learning被引用 15
一句话总结

本文提出掩码孪生卷积神经网络(MSCN),通过解决掩码增强带来的关键问题——如寄生边缘、特征不平衡和训练信号减少——实现了卷积神经网络的有效自监督表征学习。通过系统性地改进空间-通道掩码、最优掩码比例和视图共享策略,MSCN在ImageNet-1K上达到67.6%的线性探测准确率,并在目标检测基准上优于先前方法。

ABSTRACT

Self-supervised learning has shown superior performances over supervised methods on various vision benchmarks. The siamese network, which encourages embeddings to be invariant to distortions, is one of the most successful self-supervised visual representation learning approaches. Among all the augmentation methods, masking is the most general and straightforward method that has the potential to be applied to all kinds of input and requires the least amount of domain knowledge. However, masked siamese networks require particular inductive bias and practically only work well with Vision Transformers. This work empirically studies the problems behind masked siamese networks with ConvNets. We propose several empirical designs to overcome these problems gradually. Our method performs competitively on low-shot image classification and outperforms previous methods on object detection benchmarks. We discuss several remaining issues and hope this work can provide useful data points for future general-purpose self-supervised learning.

研究动机与目标

  • 识别并解决阻碍掩码孪生网络与标准卷积神经网络主干有效结合的根本性问题。
  • 开发一种基于掩码的通用、无需领域知识的增强策略,可应用于多种视觉任务。
  • 通过系统性地优化掩码策略,提升卷积神经网络在少样本图像分类和目标检测等下游任务中的性能。
  • 为在自监督学习中将掩码应用于非Transformer架构提供实证洞察与设计原则。

提出的方法

  • 提出一种多层级掩码策略,涵盖空间、通道和宏观设计维度,以减少寄生边缘效应并保持特征多样性。
  • 在两个独立视图上对标准数据增强(如随机裁剪、颜色抖动)后的特征应用掩码,以防止基于未掩码区域的表面化解决方案。
  • 优化掩码比例与网格尺寸,以平衡局部与全局特征学习,实验表明在20%–25%的掩码比例和大网格尺寸(如28×28)时性能最优。
  • 在同张图像的两个掩码视图之间使用对比学习目标,使模型学习到对掩码具有不变性的表征。
  • 在ImageNet-1K上使用ResNet-50进行100个周期的训练,并采用线性评估协议来评估表征质量。
  • 系统性地消融设计选择(如视图共享、掩码顺序),以验证各组件的有效性。

实验结果

研究问题

  • RQ1为何掩码孪生网络在标准卷积神经网络主干上失败,尽管在视觉Transformer中已取得成功?
  • RQ2掩码产生的寄生边缘如何扭曲特征学习并抑制卷积核在卷积神经网络中的表现?
  • RQ3何种掩码策略可恢复表征质量并提升基于卷积神经网络的孪生网络在下游任务中的性能?
  • RQ4基于掩码的增强策略是否可在不依赖领域特定增强的情况下实现竞争力表现?
  • RQ5掩码比例与网格尺寸如何影响卷积神经网络中局部与全局特征学习之间的平衡?

主要发现

  • 使用标准卷积神经网络的掩码孪生网络因寄生边缘、特征不平衡和掩码导致的训练信号减少而失效。
  • 所提出的MSCN方法在ImageNet-1K上达到67.6%的线性探测准确率,优于未掩码基线1.0%。
  • 掩码比例在0.20–0.25时性能最优,且在高达0.50的掩码比例下仍保持稳定。
  • 大尺寸掩码网格(如28×28)对卷积神经网络最为理想,与视觉Transformer中通常使用小尺寸patch形成对比。
  • 视图共享——即对同一增强视图应用掩码——导致性能灾难性下降(降至29.1%),证实了使用独立视图的必要性。
  • 该方法泛化能力强,在目标检测基准上优于先前方法,并展现出优异的少样本分类性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。