QUICK REVIEW
[论文解读] PaliGemma: A versatile 3B VLM for transfer
Lucas Beyer, Andreas Steiner|arXiv (Cornell University)|Jul 10, 2024
Advanced Fiber Optic Sensors被引用 11
一句话总结
PaliGemma 是一个开源、低于 3B 参数的视觉-语言模型,结合 SigLIP-So400m 图像编码器与 Gemma-2B 解码器,经过训练以在包括 VLM 基准、遥感和分割在内的多样化开放世界任务中实现迁移。
ABSTRACT
PaliGemma is an open Vision-Language Model (VLM) that is based on the SigLIP-So400m vision encoder and the Gemma-2B language model. It is trained to be a versatile and broadly knowledgeable base model that is effective to transfer. It achieves strong performance on a wide variety of open-world tasks. We evaluate PaliGemma on almost 40 diverse tasks including standard VLM benchmarks, but also more specialized tasks such as remote-sensing and segmentation.
研究动机与目标
- 提供一个通用的基础视觉-语言模型,在广泛任务集上具有良好迁移性。
- 证明一个小型、开源的 VLM 在标准和小众任务上能够匹配甚至超过更大的模型。
- 展示针对多样输出的有效多阶段预训练与迁移策略。
- 研究影响多模态预训练与迁移性能的设计选择。
- 提供实用的迁移方案,包括超参数和分辨率处理的指南。
提出的方法
- 组装一个三组件VLM:SigLIP 图像编码器、Gemma-2B 解码器LM,以及将图像标记连接到语言模型输入的线性投影。
- 通过分阶段训练:Stage0 单模态预训练,Stage1 在广泛任务混合上进行多模态预训练且不冻结参数,Stage2 提高分辨率的微调,Stage3 针对多样基准的任务特定迁移。
- 使用前缀-LM掩蔽,以便在输入(图像和前缀)上进行全注意力,并对后缀进行自回归生成,且仅对后缀进行监督训练。
- 将 Gemma 词汇扩展为 1024 个位置标记和 128 个分割标记,谨慎初始化新标记以优化迁移。
- 采用简单线性连接器(而非 MLP),在 Stage1 避免冻结图像编码器,以获得更好的空间理解和迁移性。
- 采用统一的迁移方案,在 30+ 学术基准上使用面向任务的超参数(分辨率、训练轮数、学习率、标签平滑、 dropout 等),确保图像与预训练数据去重。

实验结果
研究问题
- RQ1一个紧凑的开源 VLM(约 3B 参数)在广泛的视觉-语言任务上相比更大模型的表现如何?
- RQ2哪些预训练与训练设计选择对开源 VLM 的迁移性能影响最大?
- RQ3是否可通过分阶段预训练在迁移期间有效实现更高的图像分辨率,而不需要指数级的数据、计算或指令微调?
- RQ4有哪些实用的迁移方案(超参数、数据增强、架构选择)在标准 VLM 基准和专门任务(遥感、信息图表问答、分割、视频任务)上能取得良好结果?
主要发现
- PaliGemma(3B 规模)在标准 VLM 基准(如 COCO、VQA、TextVQA)以及专门任务(遥感 VQA、信息图表 QA、视频字幕、指称表达分割)上取得具有竞争力的性能。
- 三阶段预训练计划(单模态、带未冻结图像编码器的多模态、再提升分辨率)使模型具备对多样任务的广泛迁移性。
- 前缀-LM 掩蔽在输入全注意力和后缀自回归下优于替代方法;任务前缀有助于处理歧义任务,后缀监督效果良好。
- 添加新标记(位置标记和分割标记)需要仔细初始化(AvgEmb 可能损害长期迁移),标准高斯初始化能带来更好的迁移。
- Stage1 中不冻结图像编码器可提升空间理解和迁移性,而冻结 LLM 会降低性能;在此设置中线性连接器优于 MLP。
- 提供多个分辨率检查点(224、448、896),并通过 Stage2 循环利用,对高分辨率内容与更长序列长度的分离效应需要区分对待。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。