[论文解读] Unsupervised Learning by Predicting Noise
论文提出 Noise As Targets (NAT),一种无监督端到端训练的框架,通过将特征映射到固定的随机目标向量来实现对大型数据集(如 ImageNet)的可扩展学习。它在与最先进无监督方法的迁移性能方面具有竞争力。
Convolutional neural networks provide visual features that perform remarkably well in many computer vision applications. However, training these networks requires significant amounts of supervision. This paper introduces a generic framework to train deep networks, end-to-end, with no supervision. We propose to fix a set of target representations, called Noise As Targets (NAT), and to constrain the deep features to align to them. This domain agnostic approach avoids the standard unsupervised learning issues of trivial solutions and collapsing of features. Thanks to a stochastic batch reassignment strategy and a separable square loss function, it scales to millions of images. The proposed approach produces representations that perform on par with state-of-the-art unsupervised methods on ImageNet and Pascal VOC.
研究动机与目标
- 在没有人类标注的情况下激发学习丰富的视觉特征,以避免标签带来的偏差。
- 提出一个可扩展的端到端判别式框架,避免特征坍缩。
- 引入固定的随机目标表示和可扩展的分配机制。
- 证明 NAT 能产生可迁移的特征,与最先进的无监督方法相当。
提出的方法
- 定义一个将图像映射到单位归一化特征的映射 f_theta,并在固定目标表示的条件下联合优化 theta。
- 固定形成目标矩阵 C 的 k 个目标向量,并在一对一约束下通过一个类似排列的矩阵 P 将图像分配到目标。
- 在 f_theta(X) 与 Y=PC 之间使用平方损失,其中 P 在线更新以防止坍缩。
- 通过在单位球面上均匀采样来选择 NAT 目标,以逼近特征空间上的分布。
- 使用 SGD 进行优化,并进行基于在线匈牙利算法的分配,仅限于批次子矩阵以实现可扩展性。
- 用图像梯度和标准增强对输入进行预处理,以提升无监督信号质量。
实验结果
研究问题
- RQ1一个判别式、非生成的无监督目标是否能够产生可迁移的视觉特征?
- RQ2固定目标表示并进行在线重新分配是否在防止特征坍缩的同时保持对大数据集的可扩展性?
- RQ3不同的目标表示和更新频率如何影响学习到的表示和迁移性能?
- RQ4NAT 派生的特征在 ImageNet 和 PASCAL VOC 上是否与其他无监督和自监督方法具有竞争力?
主要发现
- NAT 在 ImageNet 上的迁移性能与最先进的无监督和自监督方法相当。
- 在单位归一化特征上使用平方损失的训练在该场景下与 softmax 损失表现相似。
- 离散的、基底样的目标在 ImageNet 迁移中不如连续的 NAT 目标。
- 每隔若干时期更新目标分配在性能和计算之间提供了良好的权衡。
- NAT 特征在视觉上捕捉到有意义的结构和边缘,类似于有监督特征,尽管锐度有些差异。
- 在 Pascal VOC 2007 上,NAT 超越了标准自编码器和 GAN 基线,与 BiGAN 竞争,同时接近自监督方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。