Skip to main content
QUICK REVIEW

[论文解读] Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization

Yang Jin, Kun Xu|arXiv (Cornell University)|Sep 9, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用 3
一句话总结

本文提出 LaVIT,一种统一的图文基础模型,通过动态离散视觉分词器将图像转换为离散标记序列,实现在单一生成目标下与文本联合进行端到端自回归预训练。该方法通过将图像视为 LLM 可读的‘外语’,在视觉语言基准上实现最先进性能,动态分词使计算量减少 36%,并优于固定长度基线方法的准确率。

ABSTRACT

Recently, the remarkable advance of the Large Language Model (LLM) has inspired researchers to transfer its extraordinary reasoning capability to both vision and language data. However, the prevailing approaches primarily regard the visual input as a prompt and focus exclusively on optimizing the text generation process conditioned upon vision content by a frozen LLM. Such an inequitable treatment of vision and language heavily constrains the model's potential. In this paper, we break through this limitation by representing both vision and language in a unified form. Specifically, we introduce a well-designed visual tokenizer to translate the non-linguistic image into a sequence of discrete tokens like a foreign language that LLM can read. The resulting visual tokens encompass high-level semantics worthy of a word and also support dynamic sequence length varying from the image. Coped with this tokenizer, the presented foundation model called LaVIT can handle both image and text indiscriminately under the same generative learning paradigm. This unification empowers LaVIT to serve as an impressive generalist interface to understand and generate multi-modal content simultaneously. Extensive experiments further showcase that it outperforms the existing models by a large margin on massive vision-language tasks. Our code and models are available at https://github.com/jy0205/LaVIT.

研究动机与目标

  • 为解决现有多模态大模型中视觉与语言处理不均衡的问题,即视觉仅被视为文本生成的提示。
  • 通过将视觉输入表示为与 LLM 的自回归下一个标记预测兼容的离散标记格式,实现联合多模态预训练。
  • 通过根据图像复杂度和语义信息量动态分配视觉标记,降低计算成本与冗余。
  • 证明在离散视觉标记上进行统一生成预训练,相比回归或适配器方法,在多模态理解与生成任务中表现更优。

提出的方法

  • 提出一种动态视觉分词器,利用可学习的码本和补丁选择器,将图像补丁转换为离散视觉标记。
  • 采用两阶段机制:首先,选择器从图像中识别出最具语义信息的补丁;其次,合并器将这些补丁压缩为可变长度的离散标记序列。
  • 使用交叉熵损失以自回归方式预测下一个离散视觉标记,使优化目标与文本标记保持一致。
  • 在分词前利用预训练视觉编码器(如 CLIP ViT-L/14)提取补丁特征,确保高层语义表征。
  • 通过在文本和视觉标记上统一使用下一个标记预测目标,端到端训练整个模型。
  • 学习到的码本生成具有语义意义的视觉标记,例如表示滑板部件或长颈鹿纹理,提升可解释性。

实验结果

研究问题

  • RQ1视觉输入能否被有效表示为与 LLM 自回归训练范式兼容的离散标记?
  • RQ2与固定长度视觉标记化相比,动态标记分配是否能提升效率与性能?
  • RQ3在视觉与语言上统一使用下一个标记预测目标,是否优于基于适配器或回归的多模态大模型方法?
  • RQ4与连续特征回归相比,离散视觉标记化在多模态理解与生成方面提升程度如何?
  • RQ5所学视觉码的可解释性与语义一致性,与标准 ViT 风格补丁表示相比如何?

主要发现

  • LaVIT 在 Flickr 上取得 74.0 FID,VQAv2 上为 57.7,OKVQA 上为 47.6,分别优于固定长度基线 2.9、1.2 和 1.2 分。
  • 动态分词策略将平均视觉标记数从 256 降低至 94,训练时间减少 40%,显著降低推理成本。
  • 将离散标记预测替换为视觉特征回归会降低性能,证明离散标记化在统一学习中的优越性。
  • 视觉分词器动态选择信息丰富的补丁,过滤冗余或背景内容,提升效率与表征质量。
  • 学习到的码本生成语义明确的视觉标记——例如代码 4107 代表滑板部件,9146 代表长颈鹿纹理——体现可解释性。
  • LaVIT 无需微调即可生成复杂图像编辑(如带猫胡须的狗肖像),展示强大的零样本多模态生成能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。