[论文解读] VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
VisionLLaMA 提出了一种受 LLaMA 语言模型启发的统一视觉 Transformer 架构,可在图像分类、检测、分割及基于扩散的生成等多样化视觉任务中实现高效且出色的性能。通过将 LLaMA 的 Transformer 设计适配至 2D 图像输入,并引入一种新型二维旋转位置编码(AS2DRoPE),该模型在无需复杂架构改进的情况下实现了更快的收敛速度和最先进性能。
Large language models are built on top of a transformer-based architecture to process textual inputs. For example, the LLaMA stands out among many open-source implementations. Can the same transformer be used to process 2D images? In this paper, we answer this question by unveiling a LLaMA-like vision transformer in plain and pyramid forms, termed VisionLLaMA, which is tailored for this purpose. VisionLLaMA is a unified and generic modelling framework for solving most vision tasks. We extensively evaluate its effectiveness using typical pre-training paradigms in a good portion of downstream tasks of image perception and especially image generation. In many cases, VisionLLaMA have exhibited substantial gains over the previous state-of-the-art vision transformers. We believe that VisionLLaMA can serve as a strong new baseline model for vision generation and understanding. Our code is released at https://github.com/Meituan-AutoML/VisionLLaMA.
研究动机与目标
- 通过将 LLaMA 的 Transformer 架构适配至 2D 图像输入,弥合视觉与语言模型之间的架构差距。
- 开发一种通用、统一的框架,使用单一主干网络解决多种视觉任务,降低模态特异性设计的复杂性。
- 通过利用 LLaMA 的架构优势(如 RMSNorm、SwiGLU 和 RoPE),提升视觉任务的训练效率与性能。
- 通过一种新型位置编码方案(AS2DRoPE),实现对多样化图像分辨率的零样本泛化能力。
提出的方法
- 提出 VisionLLaMA,一种具有 LLaMA 风格架构的视觉 Transformer,包含 RMSNorm、SwiGLU 和旋转位置嵌入(RoPE),并针对 2D 图像数据进行了适配。
- 提出 AS2DRoPE(自缩放 2D RoPE),一种可学习的 2D 旋转位置编码,通过插值缩放支持任意输入分辨率。
- 采用普通和金字塔结构的主干设计,以评估在不同视觉任务范式(如 ViT 与 Swin Transformer 风格)下的性能表现。
- 在 ImageNet 和 LAION 数据集上,对 VisionLLaMA 进行监督和自监督预训练,包括 MAE 和对比学习方法。
- 将 VisionLLaMA 集成至扩散模型(DiT 和 SiT)中,用于文生图生成,采用 CLIP 编码器的潜在扩散机制。
- 采用统一的训练流程,借鉴 LLaMA 的优化策略:先进行自监督预训练,再通过类似 RLHF 的方式执行监督微调。
实验结果
研究问题
- RQ1尽管模态结构存在差异(1D 与 2D,普通结构与金字塔结构),LLaMA 的 Transformer 架构能否在 2D 视觉任务中有效适配?
- RQ2AS2DRoPE 与标准的 2D sin-cos 位置编码及基于 NTK 的 RoPE 相比,在跨分辨率泛化能力和收敛速度方面表现如何?
- RQ3在多种视觉任务的监督和自监督预训练设置下,VisionLLaMA 是否优于现有视觉 Transformer(如 ViT、DeiT、Swin)?
- RQ4VisionLLaMA 在基于扩散的图像生成中作为主干网络的潜力有多大,特别是在图像保真度和训练效率方面?
- RQ5VisionLLaMA 相较于标准 ViT 实现更快收敛和更优性能的理论与实证依据是什么?
主要发现
- 在相同的训练设置下,使用金字塔小模型的 VisionLLaMA 在 ImageNet-1K 上实现了 81.6% 的 top-1 准确率,优于 ViT-Base 和 DeiT3-Large。
- 在 DiT-LLaMA-XL 中进行图像生成时,VisionLLaMA 生成了 256×256 高保真图像,Classifier-Free Guidance(CFG)比率为 4.0,展现出强大的生成能力。
- VisionLLaMA 的收敛速度优于 ViT 和 DeiT3-Large,在扩散训练中,SiT-LLaMA 在 300k 步时的性能已超过 ViT 在 400k 步时的表现。
- AS2DRoPE 位置编码支持在任意分辨率下进行零样本评估(如 224×224、384×384、512×512),在未微调的情况下于 512×512 分辨率上达到 79.5% 的 top-1 准确率。
- 在 MAE 预训练中,VisionLLaMA 在 800 个周期内始终保持低于 ViT-Base 的训练损失,表明其优化过程更稳定、更高效。
- 理论分析表明,VisionLLaMA 中基于 RoPE 的注意力机制相比加法位置编码,能减少内容与位置之间的相互作用,从而实现更快、更有效的学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。