[论文解读] ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
ChartAssistant 是一种用于图表理解的通用多模态语言模型,通过图表到表格的预训练以及在多样化数据集(ChartSFT)上的多任务指令微调,实现了在多个图表任务上的最先进性能。其在真实世界图表的零样本设置下显著优于 SOTA 模型(如 UniChart 和 ChartLlama),尤其在数值推理和泛化能力方面表现突出。
Charts play a vital role in data visualization, understanding data patterns, and informed decision-making. However, their unique combination of graphical elements (e.g., bars, lines) and textual components (e.g., labels, legends) poses challenges for general-purpose multimodal models. While vision-language models trained on chart data excel in comprehension, they struggle with generalization. To address these challenges, we propose ChartAssistant, a chart-based vision-language model for universal chart comprehension and reasoning. ChartAssistant leverages ChartSFT, a comprehensive dataset covering diverse chart-related tasks with basic (e.g. bars and pies) and specialized (e.g. radars, and bubbles) chart types. It undergoes a two-stage training process, starting with pre-training on chart-to-table parsing to align chart and text, followed by multitask instruction-following fine-tuning. This approach enables ChartAssistant to achieve competitive performance across various chart tasks. Experimental results demonstrate significant performance gains over the state-of-the-art UniChart and Chartllama method, especially outperforming them on real-world chart data with zero-shot setting. The code and data are available at https://github.com/OpenGVLab/ChartAst.
研究动机与目标
- 解决通用视觉-语言模型在理解包含图形和文本元素的复杂图表时的局限性。
- 通过对齐视觉表示与结构化文本表示,提升图表理解中的零样本泛化与推理能力。
- 克服现有图表模型泛化能力差的问题,避免依赖任务特定的微调。
- 构建一个全面、多样化且高质量的指令微调数据集(ChartSFT),涵盖多种图表类型和任务。
- 使单一统一模型能够在多样化的真实世界场景中,以高性能完成多种图表相关任务。
提出的方法
- 在图表到表格的翻译任务上预训练模型,以对齐视觉图表表示与结构化文本表格。
- 构建 ChartSFT,一个大规模的指令跟随数据集,包含多种图表类型(如雷达图、箱线图)、任务(问答、摘要、指代)以及标注(包括数值推理的思维链)。
- 在 ChartSFT 上进行多任务指令微调,将多种图表相关任务整合到单一统一的训练目标中。
- 采用两种模型变体:ChartAst-D(260M 参数,基于 Donut)和 ChartAst-S(130亿参数,基于 SPHINX),以兼顾效率与鲁棒性。
- 在训练中引入思维链(CoT)标注,以增强数学推理与数值问答的准确性。
- 利用 GPT-3.5 生成高质量、多样化且精确的问答对,尤其针对 arXiv 数据中的开放性推理任务。
实验结果
研究问题
- RQ1一个统一的视觉-语言模型是否能在无需任务特定微调的情况下,对多种图表类型和任务实现强大的零样本泛化能力?
- RQ2图表到表格的预训练在多大程度上改善了图表中视觉与文本表示之间的对齐?
- RQ3使用多样化图表任务进行多任务指令微调,在多大程度上提升了模型的推理与理解能力?
- RQ4思维链(CoT)标注在多大程度上提升了数值问答的性能?
- RQ5一个在广泛且多样化数据集上训练的单一模型,是否能在真实世界图表数据上超越任务特定微调的模型?
主要发现
- ChartAssistant 在所有评估的图表任务中均达到最先进性能,显著优于 UniChart 和 ChartLlama,尤其在真实世界数据的零样本设置下表现优异。
- 使用思维链(CoT)标注后,数值问答准确率从 51.9% 提升至 72.1%,在点线图和折线图上的提升分别达到 22% 和 26.6%。
- 若排除任一多任务指令微调组件,性能均出现下降,其中数值问答是整体性能最关键的组成部分。
- ChartAst-S(130亿参数变体)因继承 SPHINX 的动态分辨率处理与混合视觉编码器,展现出更优的鲁棒性与性能。
- 模型在 ChartQA(增强版)基准上达到 91.3% 的准确率,在数值问答任务上达到 72.1%,显著优于先前的 SOTA 方法。
- 消融实验表明,包含多样化图表类型(如雷达图、箱线图)与全面标注可显著提升泛化能力与模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。