Skip to main content
QUICK REVIEW

[论文解读] Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models

Munan Ning, Bin Zhu|arXiv (Cornell University)|Nov 27, 2023
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出了 Video-Bench,一个全面的基准测试与工具包,用于在三个层次上评估基于视频的大型语言模型(Video-LLMs):仅基于视频的理解、基于先验知识的问答,以及理解/决策能力。在8个模型上的评估显示,Video-LLMs在类人理解方面存在显著不足,尤其是在推理和先验知识整合方面,凸显了当前能力的关键差距,并为未来研究提供了指导。

ABSTRACT

Video-based large language models (Video-LLMs) have been recently introduced, targeting both fundamental improvements in perception and comprehension, and a diverse range of user inquiries. In pursuit of the ultimate goal of achieving artificial general intelligence, a truly intelligent Video-LLM model should not only see and understand the surroundings, but also possess human-level commonsense, and make well-informed decisions for the users. To guide the development of such a model, the establishment of a robust and comprehensive evaluation system becomes crucial. To this end, this paper proposes extit{Video-Bench}, a new comprehensive benchmark along with a toolkit specifically designed for evaluating Video-LLMs. The benchmark comprises 10 meticulously crafted tasks, evaluating the capabilities of Video-LLMs across three distinct levels: Video-exclusive Understanding, Prior Knowledge-based Question-Answering, and Comprehension and Decision-making. In addition, we introduce an automatic toolkit tailored to process model outputs for various tasks, facilitating the calculation of metrics and generating convenient final scores. We evaluate 8 representative Video-LLMs using extit{Video-Bench}. The findings reveal that current Video-LLMs still fall considerably short of achieving human-like comprehension and analysis of real-world videos, offering valuable insights for future research directions. The benchmark and toolkit are available at: \url{https://github.com/PKU-YuanGroup/Video-Bench}.

研究动机与目标

  • 为解决当前缺乏统一、全面的 Video-LLM 评估框架的问题,该框架需超越基础视频感知,捕捉多层次理解能力。
  • 识别当前 Video-LLM 能力中的关键差距,特别是常识推理、先验知识整合以及长序列理解方面。
  • 开发一个自动化评估工具包,通过概率映射和基于 LLM 的语义评估实现模型输出的高效、精准评分。
  • 通过提供关于模型架构、训练数据规模和模块设计对 Video-LLM 性能影响的实证洞察,指导未来研究。

提出的方法

  • 设计一个包含10项任务的基准测试,覆盖三个评估层级:仅基于视频的理解(如摘要、异常检测)、基于先验知识的问答(如NBA、音乐视频)、以及理解/决策能力(如3D场景理解、自动驾驶)。
  • 实现一个自动化评估工具包,通过基于概率的选择和基于 LLM 的语义相似性,将模型生成的文本输出映射到正确答案,用于指标计算。
  • 采用多种指标——基于概率的、基于 T5 的和基于 GPT 的——评估响应准确性,其中基于 GPT 的指标在开放性及可变长度输出中表现出更优的可靠性。
  • 对8个开源 Video-LLM 进行对比分析,评估视觉编码器、时间模块、音频编码器以及预训练和指令微调阶段数据规模的影响。
  • 对模型架构、模块配置(如是否包含时间模块或音频模块)以及数据规模影响进行多维分析,以识别性能驱动因素。
  • 利用基于 GPT 的指标评估长文本响应,发现当前模型虽生成流畅,但常产生错误或无关的回答,尽管其流畅度很高。

实验结果

研究问题

  • RQ1当前 Video-LLM 在多大程度上实现了对视频内容的人类级理解,特别是在需要时间推理和上下文意识的任务中?
  • RQ2Video-LLM 能在多大程度上整合外部先验知识(如体育、音乐、文化背景),而不仅限于视频中可见的内容?
  • RQ3时间模块和音频编码器等架构组件对 Video-LLM 在不同理解层级上的性能有何影响?
  • RQ4预训练和指令微调阶段的数据规模如何影响 Video-LLM 性能,特别是在视频特定理解任务中?
  • RQ5在开放性和多轮对话设置中,哪种评估指标——基于概率的、基于 T5 的,还是基于 GPT 的——最可靠地衡量 Video-LLM 输出的正确性?

主要发现

  • 仅有 Video-ChatGPT 在一项需要基本先验知识的代表性多选题中提供了正确答案,表明在整合简单外部知识方面普遍存在失败。
  • 基于 GPT 的指标在评估模型输出方面优于基于概率和基于 T5 的指标,尤其在参数量较少、输出不稳定的模型中表现更优。
  • 在大规模视频指令微调数据上训练的模型(如 Video-ChatGPT、Otter)显著优于在图像数据上训练或微调程度较低的模型,凸显了视频特定微调的重要性。
  • 预训练数据规模对性能影响有限,表明当前视觉编码器已在多模态数据上充分预训练,而指令微调数据规模是性能的强预测因子。
  • 时间模块或音频编码器的引入并未一致提升性能,表明当前模块设计可能未能有效利用时间或音频信号。
  • 当前 Video-LLM 虽能生成流畅、类人的文本,但在推理和事实依据方面缺乏可靠性,尤其在决策和常识推理任务中,表明向通用人工智能迈进仍存在关键差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。