[论文解读] A Survey on Benchmarks of Multimodal Large Language Models
本综述对180项多模态大语言模型(MLLM)基准进行了全面分析,将其分类为感知与理解、认知与推理、特定领域、关键能力及其他模态。自2024年以来,该综述识别出GPT-4和Gemini在83项基准中表现最佳,并主张将评估视为推动MLLM发展与通用人工智能(AGI)进步的核心学科。
Multimodal Large Language Models (MLLMs) are gaining increasing popularity in both academia and industry due to their remarkable performance in various applications such as visual question answering, visual perception, understanding, and reasoning. Over the past few years, significant efforts have been made to examine MLLMs from multiple perspectives. This paper presents a comprehensive review of 200 benchmarks and evaluations for MLLMs, focusing on (1)perception and understanding, (2)cognition and reasoning, (3)specific domains, (4)key capabilities, and (5)other modalities. Finally, we discuss the limitations of the current evaluation methods for MLLMs and explore promising future directions. Our key argument is that evaluation should be regarded as a crucial discipline to support the development of MLLMs better. For more details, please visit our GitHub repository: https://github.com/swordlidev/Evaluation-Multimodal-LLMs-Survey.
研究动机与目标
- 提供对180项评估多模态大语言模型(MLLM)的基准的全面、系统性综述。
- 识别并按五个关键维度对评估基准进行分类:感知与理解、认知与推理、特定领域、关键能力及其他模态。
- 分析自2024年以来顶级MLLM(如GPT-4、Gemini)在83项基准中的表现,以揭示趋势与模型优势。
- 指出当前评估实践中的局限性,并倡导将评估作为MLLM开发中的核心学科。
- 通过识别尚未充分探索的领域,指导未来研究,并推动建立稳健、可靠且可泛化的评估框架。
提出的方法
- 系统性收集并基于评估重点将180项MLLM评估基准分类为五大主要类别。
- 整理基准详情,包括任务类型、数据规模、模态支持(图像、视频、音频、3D等)、标注格式及评估协议。
- 对2024年发布的83项基准中排名前三的MLLM(GPT-4、Gemini、GPT-4V)进行性能分析,包括准确率和任务覆盖度等指标。
- 构建分类体系,按功能范围(如空间推理、幻觉检测、医学影像)组织基准,以支持跨基准比较。
- 纳入新兴基准,如M3DBench(3D推理)、ScanReason(3D定位)和MMT-Bench(全模态任务),以反映评估需求的演进。
- 对开放式基准(如MQA、开放式问题)采用基于GPT的评估方法,以实现模型间比较的标准化。
实验结果
研究问题
- RQ1MLLM基准评估中的主导类别和子类型是什么?它们在感知、推理及领域特定任务中的分布如何?
- RQ2自2024年以来,顶级MLLM(如GPT-4、Gemini)在83项基准中的表现如何比较?
- RQ3当前MLLM评估实践中的关键局限性是什么,特别是在鲁棒性、公平性及现实世界泛化能力方面?
- RQ4针对新兴模态(如3D、音频、点云)的基准在评估高级MLLM能力方面有何贡献?
- RQ5现有基准在多大程度上评估了关键的用户面向能力,如指令遵循、幻觉规避及多轮推理?
主要发现
- 自2024年以来,GPT-4和Gemini在83项基准中持续优于其他模型,表明其在多模态推理与理解方面的主导地位。
- 感知与理解类基准(如VQA、图像字幕)仍占主导地位,而认知与推理任务(如空间推理、逻辑推理)的复杂度正在提升。
- 针对3D环境(如M3DBench、ScanReason)和空间推理(如SpatialRGPT)的基准正在兴起,用于评估细粒度的空间理解能力,这正是当前MLLM的薄弱环节。
- 仅有15%的基准评估了幻觉或可信度,凸显了在评估模型可靠性与安全性方面存在的关键缺口。
- MMT-Bench和MCUB基准标志着向评估多模态共性及跨四种模态(图像、音频、视频、点云)联合推理能力的转变,预示着向整体化多模态智能评估迈进。
- 尽管基准数量持续增长,但尚未建立统一的评估框架,且许多基准在标注、评估指标或开放获取方面缺乏标准化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。