[论文解读] Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
本论文提出了 MATH-Vision(MATH-V),一个包含 3,040 道高质量数学推理问题的新基准,其问题均源自真实的数学竞赛,具有视觉情境。该基准覆盖 16 个学科和 5 个难度等级,揭示了显著的性能差距——大型多模态模型(LMMs)的准确率为 22.76%,而人类为 75.66%,凸显了当前模型在多模态数学推理方面的能力局限,并为未来改进提供了详细的错误分析。
Recent advancements in Large Multimodal Models (LMMs) have shown promising results in mathematical reasoning within visual contexts, with models approaching human-level performance on existing benchmarks such as MathVista. However, we observe significant limitations in the diversity of questions and breadth of subjects covered by these benchmarks. To address this issue, we present the MATH-Vision (MATH-V) dataset, a meticulously curated collection of 3,040 high-quality mathematical problems with visual contexts sourced from real math competitions. Spanning 16 distinct mathematical disciplines and graded across 5 levels of difficulty, our dataset provides a comprehensive and diverse set of challenges for evaluating the mathematical reasoning abilities of LMMs. Through extensive experimentation, we unveil a notable performance gap between current LMMs and human performance on MATH-V, underscoring the imperative for further advancements in LMMs. Moreover, our detailed categorization allows for a thorough error analysis of LMMs, offering valuable insights to guide future research and development. The project is available at https://mathvision-cuhk.github.io
研究动机与目标
- 为解决现有多模态数学推理基准(如 MathVista)在多样性与广度上的不足,后者受限于问题类型有限和学科覆盖狭窄。
- 开发一个全面、高质量的数学问题数据集,其问题均源自真实数学竞赛,通过专家验证确保答案的准确性与一致性。
- 实现对大型多模态模型(LMMs)在多样化数学学科与难度等级上的细粒度评估,促进详细的错误分析。
- 建立一个更严格、更具代表性的测试平台,以评估 LMM 真正的数学推理能力,超越当前基准的局限。
提出的方法
- MATH-Vision 数据集源自 19 场真实数学竞赛,确保问题真实、具有挑战性,并能代表高级数学推理。
- 所有 3,040 个问题均由专家标注员人工筛选并交叉验证,以保证答案的唯一性、正确性及数据的高质量。
- 问题按照人类验证的分类系统划分为 16 个不同的数学学科,如逻辑、算术、图论、解析几何和组合几何。
- 数据集包含 1,532 道开放问答题和 1,508 道选择题,确保评估格式的平衡性。
- 每个问题均被分配 1 至 5 的难度等级(1 为最简单,5 为最困难),支持按难度层级进行精细化性能分析。
- 在四款领先的 LMM(GPT-4V、Gemini、SPHINX、InternLM-XComposer2-VL)上进行了大量实验,评估其在不同学科与难度等级下的表现。
实验结果
研究问题
- RQ1当面对源自真实竞赛的视觉数学问题时,当前大型多模态模型(LMMs)在多样化数学领域中的泛化能力如何?
- RQ2在视觉推理任务中,模型在不同难度等级和数学学科中的表现有何差异?
- RQ3LMM 在多模态数学推理中的具体失败模式是什么?能否通过结构化的错误分析进行诊断?
- RQ4在高质量、基于竞赛的基准上,基于内部数据训练的 LMM(如 GPT-4V、Gemini)与基于公开数据训练的模型(如 SPHINX)的性能表现有何差异?
- RQ5像 MATH-Vision 这样经过精心筛选、专家验证的基准,能否揭示出在现有多样性不足的基准中被掩盖的 LMM 与人类之间的有意义性能差距?
主要发现
- 当前 LMM 在 MATH-Vision 基准上的准确率仅为 22.76%,而人类表现达到 75.66%,揭示了高达 53% 的性能差距。
- 该性能差距在拓扑学、度量几何和组合几何等高级数学领域最为显著,模型在复杂的空间与抽象推理方面表现困难。
- GPT-4V 和 Gemini 等基于内部数据训练的模型,优于基于公开数据训练的模型(如 SPHINX),表明数据质量与规模对推理能力具有显著影响。
- 错误分析显示,模型常因无法推导出正确的几何关系或错误理解视觉构型而失败,尤其在需要多步推理或非平凡对称性洞察的问题中更为明显。
- 该数据集的 16 个学科与 5 个难度等级分类体系,使得能够精准诊断模型的弱点,例如在逻辑或立体几何时表现不佳,尽管其在基础算术方面表现良好。
- 该基准揭示了当前 LMM 在泛化能力上的局限,即其难以超越对简单视觉线索的模式匹配,凸显了对更深层次推理机制的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。