Skip to main content
QUICK REVIEW

[论文解读] Split-Brain Autoencoders: Unsupervised Learning by Cross-Channel Prediction

Richard Zhang, Phillip Isola|arXiv (Cornell University)|Nov 29, 2016
Domain Adaptation and Few-Shot Learning参考文献 48被引用 15
一句话总结

本文提出了一种新型无监督表征学习方法——分裂脑自编码器(split-brain autoencoders),该方法将神经网络拆分为两个互不重叠的子网络,每个子网络负责从另一部分输入通道中预测特定的通道子集(例如,从灰度图中预测彩色信息)。通过强制进行跨通道预测,该模型学习到鲁棒且可迁移的特征,在 ImageNet、Places 和 PASCAL 线性分类基准上均达到最先进性能。

ABSTRACT

We propose split-brain autoencoders, a straightforward modification of the traditional autoencoder architecture, for unsupervised representation learning. The method adds a split to the network, resulting in two disjoint sub-networks. Each sub-network is trained to perform a difficult task -- predicting one subset of the data channels from another. Together, the sub-networks extract features from the entire input signal. By forcing the network to solve cross-channel prediction tasks, we induce a representation within the network which transfers well to other, unseen tasks. This method achieves state-of-the-art performance on several large-scale transfer learning benchmarks.

研究动机与目标

  • 解决传统自编码器在无监督表征学习中尽管结构简单,但可迁移性有限的问题。
  • 克服先前方法(如上下文自编码器和去噪自编码器)中存在的领域差距和输入受限问题。
  • 探究跨通道预测任务(如图像着色或深度预测)是否能产生强于重建或图像修复任务的更优、更具泛化能力的表征。
  • 设计一种网络架构,使所有输入通道均能对称且互补地参与特征学习,而无需在特征提取过程中丢弃任何通道。
  • 证明将两个在互补预测任务上训练的子网络结合,相比单流模型,能实现更优的迁移性能。

提出的方法

  • 提出一种分裂脑自编码器架构,包含两个互不重叠的子网络,每个子网络负责从其余通道中预测不同的输入通道子集。
  • 训练每个子网络以解决跨通道预测任务(例如,从灰度图的 L 通道预测 Lab 颜色通道)。
  • 将两个子网络的特征进行拼接,形成统一的表征,从而在特征学习过程中充分利用全部输入数据。
  • 使用 AlexNet 的全卷积变体进行预训练,将空间下采样至 12×12 分辨率,以降低计算成本,同时保留表征能力。
  • 在预训练过程中应用批量归一化,并在推理阶段将归一化参数合并到卷积层中,以确保与标准分类网络的兼容性。
  • 在基于分类的图像着色任务中使用 1-热编码而非软编码或类别重平衡,简化目标函数并提升性能。

实验结果

研究问题

  • RQ1像图像着色或深度预测这样的跨通道预测任务,能否作为无监督表征学习的有效先验任务?
  • RQ2将自编码器拆分为两个互不重叠的子网络,每个子网络预测不同的通道子集,是否能带来优于标准自编码器或上下文自编码器的特征迁移性能?
  • RQ3与先前方法相比,缺乏瓶颈层或输入扰动是否会影响所学习表征的质量与泛化能力?
  • RQ4与在特征提取过程中忽略部分输入的模型相比,是否所有输入通道均参与对称互补学习,能提升特征质量?
  • RQ5分裂脑架构在标准迁移学习基准上,相比现有最先进方法,优势程度如何?

主要发现

  • 分裂脑自编码器在 ImageNet(top-1: 72.5%,top-5: 90.5%)和 Places(top-1: 50.2%,top-5: 74.1%)上实现了线性分类准确率的最先进水平,优于先前的无监督方法。
  • 该模型在 PASCAL VOC 2012 数据集上的表现优于标准自编码器和上下文自编码器,展现出强大的零样本迁移性能。
  • 在 ImageNet 和 Places 基准上,使用 1-热编码而非软编码或类别重平衡,能提升性能,表明更简单的目标函数可能更有效。
  • 消融实验表明,拼接两个子网络的特征优于仅使用单一子网络,证实了互补学习的优势。
  • 该方法通过在完整图像上进行训练和测试,消除了上下文自编码器中存在的领域差距,并通过使用所有通道进行特征提取,避免了输入受限问题。
  • 即使在预训练阶段以 12×12 分辨率进行预测,模型仍能取得优异性能,表明高分辨率重建并非有效表征学习的必要条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。