Skip to main content
QUICK REVIEW

[论文解读] G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model

Jiahui Gao, Renjie Pi|arXiv (Cornell University)|Dec 18, 2023
Natural Language Processing Techniques被引用 5
一句话总结

本文提出 G-LLaVA,一种在 Geo170K——一个使用大语言模型生成的 170,000 个几何图像-字幕及问题-答案对的合成数据集上微调的多模态大语言模型,以增强几何推理能力。G-LLaVA 在 MathVista 的几何基准测试中达到最先进性能,仅用 70 亿参数便超越 GPT-4-V,证明了在领域内数据增强在几何问题求解中的有效性。

ABSTRACT

Large language models (LLMs) have shown remarkable proficiency in human-level reasoning and generation capabilities, which encourages extensive research on their application in mathematical problem solving. However, current work has been largely focused on text-based mathematical problems, with limited investigation in problems involving geometric information. Addressing this gap, we aim to enable LLMs to solve geometric problems by understanding image input. We first analyze the limitations of current Multimodal Large Language Models (MLLMs) in this area: they struggle to accurately comprehending basic geometric elements and their relationships. To overcome these challenges, we take advantage of the unique characteristics of geometric problems (such as unique geometric logical form, and geometric scalability) and the capacity of the textual LLMs to build an enriched multimodal geometry dataset based on existing data. The augmented dataset, Geo170K, contains more than 170K geometric image-caption and question-answer pairs. Utilizing our constructed Geo170K dataset, we develop G-LLaVA, which demonstrates exceptional performance in solving geometric problems, significantly outperforming GPT-4-V on the MathVista benchmark with only 7B parameters.

研究动机与目标

  • 为解决现有多模态大语言模型(MLLMs)在理解几何图形与关系方面的有限能力。
  • 克服多模态学习领域中现有几何推理数据集稀缺且质量低下的问题。
  • 开发一种利用仅文本大语言模型生成高质量、多样化几何视觉-文本数据的方法。
  • 训练一种通过领域内预训练与指令微调在几何问题求解方面表现卓越的多模态模型。
  • 证明利用几何逻辑与可扩展性的数据增强可显著提升 MLLM 在几何推理任务中的性能。

提出的方法

  • 作者利用几何的独特结构与逻辑特性——如几何可扩展性、表示唯一性与逻辑形式——通过仅文本的大语言模型,从现有数据集中合成图像-字幕对与问题-答案对,生成 Geo170K 数据集。
  • 该模型采用两阶段训练:首先通过投影头实现视觉与文本特征的跨模态对齐,随后使用精心筛选的、领域内数据进行指令微调。
  • 训练期间,图像被调整为正方形格式并添加白色填充,数据增强包括最多 25% 的图像内容平移。
  • 该模型使用可学习的投影层,并在对齐与指令微调阶段同时微调视觉编码器与语言模型。
  • 评估采用基于正则表达式的答案提取方式,以 Top-1 准确率衡量,并通过提示模型以固定格式输出选项以确保一致性。
  • 明确对对齐阶段进行消融实验,以验证其对几何理解的贡献。

实验结果

研究问题

  • RQ1使用大语言模型进行合成数据生成是否能显著提升 MLLM 在几何推理任务中的表现?
  • RQ2在精心筛选的大规模几何数据集上进行领域内预训练是否能增强 MLLM 对几何图形与关系的理解?
  • RQ3一个 70 亿参数的 MLLM 是否能在几何问题求解中超越更大、更强大的模型(如 GPT-4-V)?
  • RQ4跨模态对齐在多大程度上提升了模型对角度、线条与形状等几何元素的解释能力?
  • RQ5该模型在不同类型与难度级别的几何问题上具有多大程度的泛化能力?

主要发现

  • G-LLaVA-7B 在 MathVista 基准测试的几何划分中超越 GPT-4-V,达到 64.2% 的 Top-1 准确率,证明了在更优领域内数据下,小型模型可超越大型模型。
  • G-LLaVA-13B 在同一基准测试中达到 67.0% 的 Top-1 准确率,在 GPS 最小测试集上比 LLaVA-13B 提升 27.4 个百分点。
  • 在推理复杂度更高的问题中(OP >= 4),G-LLaVA-7B 保持 40.9% 的准确率,显著优于 LLaVA-7B 的 22.9%。
  • 该模型在角度相关问题上达到 70.7% 的准确率,在长度问题上达到 56.5%,在所有几何问题类型中均优于基线模型。
  • 消融研究证实,跨模态对齐阶段使性能提升 1.4 个百分点(从 62.8% 提升至 64.2%),证明其在增强视觉理解方面的有效性。
  • G-LLaVA 的 Top-1 准确率超过先前最先进方法(如 Geoformer 的 46.8% 与 UniMath 的 50.0%)的 Top-10 准确率,表明其具备更优的预测精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。