Skip to main content
QUICK REVIEW

[论文解读] Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception

Hassan Akbari, Dan Kondratyuk|arXiv (Cornell University)|May 10, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

本文提出集成多模态感知(IMP),一种可扩展的、模态无关的训练框架,结合交替梯度下降(AGD)与专家混合模型(MoE),在单一Transformer编码器中统一图像、视频、文本和音频建模。通过在不同任务、模态和分辨率之间交替训练,并采用稀疏MoE专家,IMP仅使用先前模型15%的计算量,即实现了SOTA级别的零样本视频分类性能(Kinetics-400数据集上达到77.0%)。

ABSTRACT

We present Integrated Multimodal Perception (IMP), a simple and scalable multimodal multi-task training and modeling approach. IMP integrates multimodal inputs including image, video, text, and audio into a single Transformer encoder with minimal modality-specific components. IMP makes use of a novel design that combines Alternating Gradient Descent (AGD) and Mixture-of-Experts (MoE) for efficient model and task scaling. We conduct extensive empirical studies and reveal the following key insights: 1) Performing gradient descent updates by alternating on diverse modalities, loss functions, and tasks, with varying input resolutions, efficiently improves the model. 2) Sparsification with MoE on a single modality-agnostic encoder substantially improves the performance, outperforming dense models that use modality-specific encoders or additional fusion layers and greatly mitigates the conflicts between modalities. IMP achieves competitive performance on a wide range of downstream tasks including video classification, image classification, image-text, and video-text retrieval. Most notably, we train a sparse IMP-MoE-L variant focusing on video tasks that achieves new state-of-the-art in zero-shot video classification: 77.0% on Kinetics-400, 76.8% on Kinetics-600, and 68.3% on Kinetics-700, improving the previous state-of-the-art by +5%, +6.7%, and +5.8%, respectively, while using only 15% of their total training computational cost.

研究动机与目标

  • 设计一种可扩展的、统一的多模态学习框架,无需模态特异性架构即可整合图像、视频、文本、音频等多种输入。
  • 解决大规模多模态模型高效训练的挑战,避免性能下降与高计算成本。
  • 实现新任务、新数据集和损失函数的无缝集成,无需重新训练或架构重构。
  • 通过结合AGD实现任务交替与MoE实现稀疏专家路由,提升模型泛化能力与参数效率。
  • 在多模态理解任务中实现SOTA性能,尤其在零样本视频动作识别方面。

提出的方法

  • 模型采用单一共享的Transformer编码器,无任何模态特异性编码器,实现模态无关的学习。
  • 通过在训练过程中循环切换不同模态、任务与损失函数,应用交替梯度下降(AGD),以提升收敛性与泛化能力。
  • 训练过程动态交替变化输入分辨率、序列长度与批量大小,以维持效率与稳定性。
  • 在统一编码器中应用专家混合模型(MoE),实现每个token的稀疏专家激活,从而在不按比例增加计算成本的前提下扩展模型容量。
  • 使用JAX原语实现高效的MoE与AGD训练,支持高吞吐量与低内存开销。
  • 采用对比损失(图像-文本、视频-文本、视频-音频)与各模态的分类头联合训练模型。
(a) The IMP model architecture.
(a) The IMP model architecture.

实验结果

研究问题

  • RQ1在不同模态与任务之间交替使用梯度下降,是否能提升多模态学习中的收敛性与泛化能力?
  • RQ2采用专家混合模型(MoE)的统一模态无关编码器,是否在性能与效率上优于多塔或模态特异性架构?
  • RQ3稀疏MoE路由是否能有效缓解统一多模态编码器中的参数瓶颈,同时保持各模态的准确率?
  • RQ4AGD在多大程度上可实现任务与数据集的增量扩展,而不会损害训练效率?
  • RQ5单个稀疏模型是否能在显著降低计算量的前提下,实现零样本视频理解的SOTA性能?

主要发现

  • IMP-MoE-L模型在Kinetics-400数据集上实现77.0%的零样本准确率,较之前SOTA提升5.0%,且仅使用15%的训练计算量。
  • 在Kinetics-600数据集上,IMP-MoE-L达到76.8%的准确率,较先前方法提升6.7%,计算成本保持一致。
  • 在Kinetics-700数据集上,模型实现68.3%的零样本准确率,较基线提升5.8%,展现出对更大动作类别集合的强大泛化能力。
  • 仅使用4个专家的MoE即显著提升零样本图像分类准确率,扩展至16个专家后,在所有下游任务中均实现一致性能增益。
  • 单塔MoE模型在参数效率与计算效率上均优于多塔密集模型,在参数更少的情况下准确率更高。
  • MoE有效缓解了模态干扰,与密集基线相比,显著降低了添加音频对图像与视频性能的负面影响。
(b) The AGD-based multi-data multi-objective training overview.
(b) The AGD-based multi-data multi-objective training overview.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。