[论文解读] Distribution Estimation to Automate Transformation Policies for Self-Supervision
本文提出一种基于生成对抗网络(GAN)的框架,用于自动学习数据集中存在的视觉变换分布,并生成互补的变换以用于自监督学习(SSL)。通过对抗学习估计固有的变换分布,并从中采样互补分布,该方法生成有效的先验任务,从而提升下游表示学习性能,在多个基准测试(包括MNIST、SVHN、CIFAR-10 和 CIFAR-100)上达到最先进水平。
In recent visual self-supervision works, an imitated classification objective, called pretext task, is established by assigning labels to transformed or augmented input images. The goal of pretext can be predicting what transformations are applied to the image. However, it is observed that image transformations already present in the dataset might be less effective in learning such self-supervised representations. Building on this observation, we propose a framework based on generative adversarial network to automatically find the transformations which are not present in the input dataset and thus effective for the self-supervised learning. This automated policy allows to estimate the transformation distribution of a dataset and also construct its complementary distribution from which training pairs are sampled for the pretext task. We evaluated our framework using several visual recognition datasets to show the efficacy of our automated transformation policy.
研究动机与目标
- 为解决在无需人工设计的情况下,为自监督学习(SSL)选择有效视觉变换策略的挑战。
- 识别数据集中已存在的变换,因为先前研究表明这些变换在先验任务中可能效果较差。
- 自动生成数据集中缺失的互补变换分布,从而构建更有效的SSL先验任务。
- 通过实证验证,基于估计分布生成的变换策略在下游性能上优于人工或随机选择的策略。
提出的方法
- 使用生成对抗网络(GAN)框架,通过从已知先验分布(如高斯分布)映射到数据的变换分布,来估计数据集中存在的视觉变换分布。
- 通过对抗损失训练映射网络,使其生成的变换参数直方图与数据集中变换的经验分布相匹配。
- 通过反转估计的分布来构建互补分布,从而实现对数据中尚未存在的变换进行采样。
- 从互补分布中生成变换实例,以定义有效的SSL先验任务,如旋转预测或实例判别。
- 使用标准SSL基准(包括RotNet和VTSS)对方法进行评估,并通过消融研究比较人工与自动变换选择的效果。
- 通过将自动变换策略应用于生成正样本增强,将该方法扩展至对比学习(SimCLR)设置,从而在跨域数据集上提升微调性能。
实验结果
研究问题
- RQ1如何自动估计给定数据集中已存在的视觉变换分布?
- RQ2如何有效生成与数据集固有变换分布互补的变换实例?
- RQ3使用自动生成的、互补的变换是否能带来优于人工选择或随机采样变换的自监督表示?
- RQ4与现有方法(如RotNet和VTSS)相比,自动变换策略在下游性能上表现如何?
- RQ5所提出的方法是否能在有限标注数据的对比学习设置中提升性能?
主要发现
- 在FMNIST上,该方法达到93.22%的准确率,优于RotNet(91.94%)和VTSS(92.18%)的相同设置。
- 在SVHN上,该方法达到94.75%的准确率,显著优于RotNet(91.29%)和VTSS(91.72%)。
- 在CIFAR-10上,该方法与VTSS(89.58%)持平,但在受控基线比较中达到87.01%,表现出稳健性。
- 在CIFAR-100上,该方法达到64.00%的准确率,略高于VTSS(64.87%)的完整比较结果,且在基线比较中达到62.48%。
- 在跨域数据集的对比学习中,自动变换策略(ATP)在ChestX上达到42.33%的准确率,优于基线(41.16%)、Rot.(38.24%)和Aff.(40.65%)。
- 结果证实,变换选择显著影响SSL性能,而基于数据驱动的自动策略学习可生成优于随机或人工选择的表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。