Skip to main content
QUICK REVIEW

[论文解读] MovieChat: From Dense Token to Sparse Memory for Long Video Understanding

Enxin Song, Wenhao Chai|arXiv (Cornell University)|Jul 31, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

MovieChat 提出了一种新颖的内存增强框架,通过使用密集视频标记的滑动窗口以及两阶段记忆机制——短期(动态)和长期(压缩)——实现在大型语言模型中对长视频的高效理解。该方法在长达 10K+ 帧的长视频上实现了最先进性能,同时每帧的显存成本较之前方法降低 10,000 倍,并引入了 MovieChat-1K 基准数据集,包含 1K 个长视频和 14K 个人工标注的问答对。

ABSTRACT

Recently, integrating video foundation models and large language models to build a video understanding system can overcome the limitations of specific pre-defined vision tasks. Yet, existing systems can only handle videos with very few frames. For long videos, the computation complexity, memory cost, and long-term temporal connection impose additional challenges. Taking advantage of the Atkinson-Shiffrin memory model, with tokens in Transformers being employed as the carriers of memory in combination with our specially designed memory mechanism, we propose the MovieChat to overcome these challenges. MovieChat achieves state-of-the-art performance in long video understanding, along with the released MovieChat-1K benchmark with 1K long video and 14K manual annotations for validation of the effectiveness of our method.

研究动机与目标

  • 解决多模态大语言模型处理长视频时带来的高计算与内存开销问题。
  • 克服在长视频理解中保持长期时间依赖性的挑战。
  • 开发一种支持端到端长视频推理且内存开销极小的系统。
  • 建立标准化基准以评估长视频理解系统。
  • 通过借鉴生物启发的记忆架构,整合视觉基础模型与大语言模型,实现可扩展的视频理解。

提出的方法

  • 使用滑动窗口从帧中提取密集视频标记,并在短期记忆缓冲区中顺序处理这些标记。
  • 采用固定长度的短期记忆,通过丢弃最旧的标记并将其整合到长期记忆中实现动态更新。
  • 应用投影层将整合后的短期标记压缩为紧凑且持久的长期记忆表征。
  • 将长期记忆表征与大语言模型集成,以支持用户交互与推理。
  • 以 Atkinson-Shiffrin 记忆模型为灵感,将短期记忆建模为缓冲区,长期记忆建模为稳定且压缩的存储。
  • 使用前一窗口的合并标记作为下一窗口的初始化,相比其他初始化策略,提升了连贯性与性能。

实验结果

研究问题

  • RQ1记忆增强架构能否有效降低多模态大语言模型在长视频理解中的计算与内存成本?
  • RQ2短期记忆长度与压缩之间的平衡如何影响长视频任务的性能?
  • RQ3生物启发的记忆机制能否提升视频理解中的长期时间推理能力?
  • RQ4短期记忆的不同初始化策略对下游性能有何影响?
  • RQ5统一框架在多大程度上能够同时支持长视频的全局与断点模式问答?

主要发现

  • MovieChat 在 MovieChat-1K 基准上实现了最先进性能,时间理解(TU)得分为 3.12,一致性(CO)得分为 3.12。
  • 该系统仅使用 24GB 显存即可实现 10,000+ 帧视频的推理,相比之前方法,每帧显存成本降低 10,000 倍。
  • 性能在中等长度的记忆缓冲区下达到峰值,表明信息保留与压缩损失之间存在最优权衡。
  • 使用前一窗口合并标记进行初始化的性能最佳,优于最后标记或均匀采样方法。
  • 该框架在多种长视频类型(包括动画、电视剧和混剪视频)中,无论在全局还是断点问答模式下,均保持强劲性能。
  • MovieChat-1K 基准展示了高质量的人工标注数据,包含 14,000 个问答对,可为长视频理解系统提供可靠的评估基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。