Skip to main content
QUICK REVIEW

[论文解读] Analogous to Evolutionary Algorithm: Designing a Unified Sequence Model

Jiangning Zhang, Chao Xu|arXiv (Cornell University)|May 31, 2021
Evolutionary Algorithms and Applications参考文献 78被引用 13
一句话总结

该论文通过将视觉变换器(Vision Transformers)与进化算法(Evolutionary Algorithms, EA)进行类比,提出了一种统一的序列模型EAT(受进化算法启发的变换器),揭示了自注意力/突变与交叉/突变算子之间的一致数学形式。该模型在并行引入局部算子的同时,利用空间填充曲线(SFC)将多模态数据序列化为一维序列,并设计了任务特定的输出头以实现灵活的多任务学习,在ImageNet-1k上实现了SOTA性能(top-1准确率为80.264),且参数量更少、吞吐量更高。

ABSTRACT

Inspired by biological evolution, we explain the rationality of Vision Transformer by analogy with the proven practical Evolutionary Algorithm (EA) and derive that both of them have consistent mathematical representation. Analogous to the dynamic local population in EA, we improve the existing transformer structure and propose a more efficient EAT model, and design task-related heads to deal with different tasks more flexibly. Moreover, we introduce the spatial-filling curve into the current vision transformer to sequence image data into a uniform sequential format. Thus we can design a unified EAT framework to address multi-modal tasks, separating the network architecture from the data format adaptation. Our approach achieves state-of-the-art results on the ImageNet classification task compared with recent vision transformer works while having smaller parameters and greater throughput. We further conduct multi-modal tasks to demonstrate the superiority of the unified EAT, e.g., Text-Based Image Retrieval, and our approach improves the rank-1 by +3.7 points over the baseline on the CSS dataset.

研究动机与目标

  • 通过将视觉变换器与已知在优化中具有稳定性和鲁棒性的进化算法(EA)进行类比,为视觉变换器的训练过程提供理论依据。
  • 通过引入受EA启发的动态局部种群概念,提升视觉变换器的效率与性能,从而提出一种新型EAT架构,其包含并行的局部算子。
  • 通过使用空间填充曲线(SFC)将二维/三维数据转换为一致的一维序列格式,实现多模态序列建模的统一,实现数据表示与网络架构的解耦。
  • 通过设计与任务相关的输出头,使其与变换器主干网络集成,实现下游任务中灵活的、任务特定的特征融合,提升迁移学习能力。
  • 在分类和多模态任务(包括基于文本的图像检索)中,全面展示统一EAT框架的优越性。

提出的方法

  • 将视觉变换器的训练流程类比为基本的进化算法(EA),识别出等价组件:图像块嵌入作为个体,多头自注意力(MSA)作为全局交叉,前馈网络(FFN)作为突变。
  • 推导EA算子(交叉与突变)与神经网络组件(MSA与FFN)之间的数学等价性,证明其功能形式一致。
  • 通过引入并行的局部算子(如一维卷积、局部MSA)于全局MSA之外,提出EAT模型,受EA中动态局部种群概念启发,以提升速度与效率。
  • 引入空间填充曲线(SFC)模块,将栅格化的二维/三维数据(图像、视频)转换为一维序列,实现跨模态输入的一致性,避免二维重塑。
  • 设计与任务相关的输出头,与EAT主干网络对接,实现灵活的任务特定特征融合,提升下游迁移学习性能。
  • 采用统一的EAT框架,将网络架构与数据格式适配分离,使单一模型可处理多样化模态。

实验结果

研究问题

  • RQ1视觉变换器的训练动态能否通过与进化算法(EA)的类比获得理论解释?二者是否具有一致的数学形式?
  • RQ2通过引入并行局部算子实现的动态局部种群概念,如何提升视觉变换器的效率与性能?
  • RQ3空间填充曲线(SFC)能否有效将多模态数据(如图像、视频)序列化为一维序列格式,同时保留空间结构以支持一维操作?
  • RQ4具有任务特定头的统一EAT框架,在分类与多模态任务(包括基于文本的图像检索)中,其泛化能力在多大程度上得以体现?
  • RQ5与现有视觉变换器相比,EAT模型在准确率、参数量和推理吞吐量方面表现如何?

主要发现

  • EAT模型在ImageNet-1k上实现了80.264的top-1准确率,优于近期的视觉变换器方法,且参数量更少、吞吐量更高。
  • 消融实验表明,将头层数从1层增加到4层可提升准确率(从79.692提升至80.454),2层被选为性能与参数效率之间的折中。
  • 局部算子比例为0.50时性能最优;更高比例(如0.75)会降低准确率并增加参数量。
  • SFC模式显著影响性能:Z-Order与SIS(顺序索引方案)优于Sweep与Scan,其中Z-Order/SIS在256×256图像上达到80.438的top-1准确率。
  • 将局部算子替换为深度可分离卷积(DCN)后,准确率急剧下降至68.070,表明模型对超参数调优与架构选择高度敏感。
  • 在基于文本的图像检索的CSS数据集上,EAT模型相较基线模型将rank-1准确率提升了+3.7个百分点,展现出强大的多模态能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。