[论文解读] ResMLP: Feedforward networks for image classification with data-efficient training
ResMLP 是一种用于图像分类的简单纯前馈神经网络架构,通过线性块交互替代自注意力机制,在数据高效训练下实现了 ImageNet-1k 上的最先进准确率。它仅使用线性层和 GELU 激活函数,性能达到或超过 ViT,证明了现代训练策略可使仅含 MLP 的模型在无需卷积或注意力等结构先验的情况下依然极为高效。
We present ResMLP, an architecture built entirely upon multi-layer perceptrons for image classification. It is a simple residual network that alternates (i) a linear layer in which image patches interact, independently and identically across channels, and (ii) a two-layer feed-forward network in which channels interact independently per patch. When trained with a modern training strategy using heavy data-augmentation and optionally distillation, it attains surprisingly good accuracy/complexity trade-offs on ImageNet. We also train ResMLP models in a self-supervised setup, to further remove priors from employing a labelled dataset. Finally, by adapting our model to machine translation we achieve surprisingly good results. We share pre-trained models and our code based on the Timm library.
研究动机与目标
- 探索仅使用多层感知机(MLP)架构是否能在无卷积或自注意力归纳偏置的情况下实现图像分类的强劲性能。
- 研究数据高效训练策略(如强数据增强和知识蒸馏)是否能使简单 MLP 模型达到或超越视觉 Transformer 的性能。
- 评估此类模型在其他任务中的泛化能力,特别是序列到序列 任务(如机器翻译)中的表现。
- 分析模型的内部表征,以理解在训练极简架构时会涌现出何种归纳偏置。
提出的方法
- ResMLP 通过将非重叠图像块线性投影为 d 维嵌入来处理图像。
- 网络交替使用两种残差块:(1) 跨块线性层,通过共享权重实现块间的交互;(2) 两层前馈网络,实现每个块内的通道间交互。
- 每个块使用残差连接和预归一化,类似于 ResNet 和 DeiT,但省略了批量归一化或层归一化。
- 最终将块表示平均后输入线性分类器,实现图像级别的预测。
- 使用交叉熵损失进行训练,结合数据增强,可选地使用教师模型进行知识蒸馏。
- ResMLP 的序列到序列变体被用于机器翻译任务,将 Transformer 的层替换为 ResMLP 块,同时保留编码器与解码器之间的交叉注意力机制。
实验结果
研究问题
- RQ1在数据高效训练下,一种完全前馈的网络(无注意力或卷积归纳偏置)是否能在 ImageNet-1k 上实现具有竞争力的性能?
- RQ2在相同现代训练范式下,极简 MLP 架构的性能与视觉 Transformer 相比如何?
- RQ3自监督预训练或知识蒸馏在多大程度上能提升简单 MLP 基模型的准确率?
- RQ4基于 ResMLP 的架构能否泛化到其他领域,如序列到序列 任务(如机器翻译)?
- RQ5在极简 MLP 架构中,学习到的滤波器会涌现出何种归纳偏置?其与卷积或注意力机制相比有何异同?
主要发现
- ResMLP 在仅使用线性层和前馈网络的简单架构下,实现了 ImageNet-1k 上的最先进准确率,在相同训练范式下超越或匹配了 ViT 的性能。
- 当使用相同的数据增强和蒸馏策略时,该模型的训练比视觉 Transformer 更稳定,因此可省去批量归一化或层归一化。
- 线性层的可视化显示,早期层的滤波器模式类似于卷积,深层则表现出长程交互特征,表明出现了潜在的空间归纳偏置。
- ResMLP 显著受益于知识蒸馏,在标签数据有限时也能实现高准确率。
- 该模型兼容自监督预训练方法(如 DINO),可在无需任何标注数据的情况下实现强大性能。
- ResMLP 的序列到序列版本在 WMT 机器翻译基准上取得了具有竞争力的结果,证明了其在计算机视觉之外任务的可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。