[论文解读] Self-Supervised Feature Learning by Learning to Spot Artifacts
本文提出一种自监督特征学习方法,通过训练判别器来区分真实图像与通过损坏编码特征并利用容量有限的网络修复后生成的具有合成伪影的图像。通过迫使判别器检测全局不一致性和缺失的特征条目,该模型学习到高质量且可迁移的表征,在无需人工标注的情况下,在 ImageNet、Pascal VOC 和 STL-10 基准上实现了最先进性能。
We introduce a novel self-supervised learning method based on adversarial training. Our objective is to train a discriminator network to distinguish real images from images with synthetic artifacts, and then to extract features from its intermediate layers that can be transferred to other data domains and tasks. To generate images with artifacts, we pre-train a high-capacity autoencoder and then we use a damage and repair strategy: First, we freeze the autoencoder and damage the output of the encoder by randomly dropping its entries. Second, we augment the decoder with a repair network, and train it in an adversarial manner against the discriminator. The repair network helps generate more realistic images by inpainting the dropped feature entries. To make the discriminator focus on the artifacts, we also make it predict what entries in the feature were dropped. We demonstrate experimentally that features learned by creating and spotting artifacts achieve state of the art performance in several benchmarks.
研究动机与目标
- 开发一种无需人工标注数据的自监督方法,以学习可迁移的视觉特征。
- 设计一种掩码任务,通过训练模型检测合成伪影,以促进学习语义上有意义的对象表征。
- 通过损坏编码特征并使用容量有限的修复网络,生成逼真但受损的图像。
- 通过要求判别器预测被丢弃的特征条目位置,提升其泛化能力,从而将注意力集中于对象级细节。
- 在多个标准基准上实现最先进水平的迁移学习性能。
提出的方法
- 预训练一个高容量自编码器以学习图像表征,随后冻结其编码器。
- 通过随机丢弃条目来损坏编码特征,以生成合成伪影。
- 通过添加一个修复网络来增强解码器,该网络填补缺失条目,但容量有限,以防止完全恢复。
- 通过对抗方式训练判别器,以区分真实图像与受损图像,同时预测被丢弃条目的掩码。
- 仅使用真实掩码限制修复网络的更新仅作用于被丢弃的特征位置,从而限制全局一致性。
- 从判别器的中间层提取特征用于迁移学习,在下游任务中使用线性分类器。
实验结果
研究问题
- RQ1基于检测合成伪影的自监督学习方法是否能在迁移学习中超越现有掩码任务?
- RQ2要求判别器预测被丢弃特征的位置是否能提升特征质量与泛化能力?
- RQ3容量有限的修复网络能否在保留全局不一致性的同时生成逼真图像,使判别器能够检测到?
- RQ4所提方法是否在 ImageNet、Pascal VOC 和 STL-10 等标准基准上实现最先进性能?
- RQ5判别器学习到的特征是否比标准 GAN 或自编码器设置下的特征更具语义意义?
主要发现
- 在 ImageNet 上,使用线性分类器对冻结特征进行评估,该方法达到 19.5% 的 top-1 准确率,优于表 4 中列出的所有先前自监督方法。
- 在 Places 数据集上,该方法在 conv5 层达到 37.3% 的 top-1 准确率,为表 5 中所有对比方法中的最高值。
- Grad-CAM 可视化显示,判别器聚焦于头部和腿部等物体部分,表明其具备语义注意力。
- 判别器第一卷积层的特征在 Places 数据集上达到 23.3% 的准确率,略高于在相同层上使用监督 ImageNet 预训练的模型。
- 在所有评估基准上,该方法均优于先前的自监督方法,如 Noroozi 等人 [29] 和 Zhang 等人 [45] 的方法。
- 定性分析表明,判别器学习到了边缘检测器和对象部件感知特征,与监督模型类似。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。