Skip to main content
QUICK REVIEW

[论文解读] DeepSpeed-VisualChat: Multi-Round Multi-Image Interleave Chat via Multi-Modal Causal Attention

Zhewei Yao, Xiaoxia Wu|arXiv (Cornell University)|Sep 25, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

DeepSpeed-VisualChat 引入了一个完全开源的框架,用于多轮、多图像对话,采用一种新颖的多模态因果注意力(MMCA)机制,实现在视觉与语言模态之间高效、可扩展且无需参数的注意力机制。通过数据混合与优化训练,该框架在不增加额外参数或训练成本的前提下,实现了高达 700 亿参数语言模型的最先进可扩展性,在交错的视觉-文本推理任务中表现优于现有模型。

ABSTRACT

Most of the existing multi-modal models, hindered by their incapacity to adeptly manage interleaved image-and-text inputs in multi-image, multi-round dialogues, face substantial constraints in resource allocation for training and data accessibility, impacting their adaptability and scalability across varied interaction realms. To address this, we present the DeepSpeed-VisualChat framework, designed to optimize Large Language Models (LLMs) by incorporating multi-modal capabilities, with a focus on enhancing the proficiency of Large Vision and Language Models in handling interleaved inputs. Our framework is notable for (1) its open-source support for multi-round and multi-image dialogues, (2) introducing an innovative multi-modal causal attention mechanism, and (3) utilizing data blending techniques on existing datasets to assure seamless interactions in multi-round, multi-image conversations. Compared to existing frameworks, DeepSpeed-VisualChat shows superior scalability up to 70B parameter language model size, representing a significant advancement in multi-modal language models and setting a solid foundation for future explorations.

研究动机与目标

  • 解决视觉-语言模型中缺乏开源、可扩展的多轮、多图像、交错文本与图像对话框架的问题。
  • 克服现有模型在处理交错输入方面能力有限,且无法超越小型语言模型(如 70 亿至 130 亿参数)的局限性。
  • 开发一种参数高效的注意力机制,避免引入额外模块,同时实现强大的跨模态对齐。
  • 通过在现有数据集上应用数据混合技术,提升训练效率与模型泛化能力。
  • 利用 DeepSpeed 框架,展示视觉-语言模型在 700 亿参数规模下的可扩展性。

提出的方法

  • 提出多模态因果注意力(MMCA),一种模态特定的注意力机制,可在每个模态内独立计算注意力,同时在不引入额外参数的情况下实现跨模态交互。
  • 采用数据混合技术,从现有数据集中合成交错的图文对话,以应对此类训练数据稀缺的问题。
  • 利用 DeepSpeed 框架,结合 ZeRO 优化技术,训练大规模模型(最高达 700 亿参数),实现高效且可扩展的训练。
  • 采用视觉编码器(20 亿参数)与 LLaMa-2 语言解码器(130 亿或 700 亿参数),并通过投影层实现模态融合;然而,由于未带来性能提升,最终放弃了视觉 Transformer 的投影层。
  • 应用提示微调与超参数自适应技术以优化性能,尤其针对 LLaMa-2-700B 等大模型。
  • 通过消融研究,对比使用与不使用 SparklesChat 数据训练的模型,分析提示敏感性与幻觉之间的权衡。

实验结果

研究问题

  • RQ1一个完全开源的框架是否能够支持多轮、多图像对话,且具备交错的文本与图像输入?
  • RQ2所提出的多模态因果注意力(MMCA)机制是否能在不引入额外参数的前提下,实现与交叉注意力相当的性能?
  • RQ3数据混合技术是否能有效模拟来自非交错数据集的交错视觉-文本对话?
  • RQ4视觉-语言模型在多大程度上可扩展至 700 亿参数,同时保持训练效率与性能?
  • RQ5引入外部数据(如 SparklesChat)在多大程度上影响模型鲁棒性与提示敏感性?

主要发现

  • DeepSpeed-VisualChat 展现出卓越的可扩展性,成功训练出 700 亿参数语言模型与 20 亿参数视觉编码器,证明了大规模实现的可行性。
  • MMCA 机制在不引入额外参数的前提下,实现了强大的跨模态对齐,相比标准因果注意力,显著提升了训练数据效率。
  • 引入 SparklesChat 数据可增强叙事生成能力,但同时增加了提示敏感性,表明训练数据中可能存在潜在的分布不平衡。
  • 采用数据混合训练的模型在多图像、多轮对话任务中表现出更强的泛化能力,但使用涉及图像重排的复杂混合策略时性能有所下降。
  • 130 亿参数模型变体(DeepSpeed-VisualChat-13B-Set2)的提示敏感性高于基线模型(Set1),表明数据构成对模型鲁棒性具有显著影响。
  • 使用为 130 亿参数模型调优的超参数训练 700 亿参数模型时,结果表现欠佳,表明未来工作需针对不同模型进行特定的超参数自适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。