[论文解读] StructChart: On the Schema, Metric, and Augmentation for Visual Chart Understanding
本文提出 StructChart,一种统一的、标签高效的联合视觉图表感知与推理框架,通过引入结构化三元组表示(STR)以缩小感知-推理任务差距,提出一种新型面向图表的结构化表示度量(SCRM)用于评估,并采用基于大语言模型(LLM)的数据增强方法以提升泛化能力。实验表明,使用 STR 和 SimChart9K 合成数据集可显著提升性能,尤其在少样本设置下,在 ChartQA 及其他下游任务中优于先前方法。
Charts are common in literature across various scientific fields, conveying rich information easily accessible to readers. Current chart-related tasks focus on either chart perception that extracts information from the visual charts, or chart reasoning given the extracted data, e.g. in a tabular form. In this paper, we introduce StructChart, a novel framework that leverages Structured Triplet Representations (STR) to achieve a unified and label-efficient approach to chart perception and reasoning tasks, which is generally applicable to different downstream tasks, beyond the question-answering task as specifically studied in peer works. Specifically, StructChart first reformulates the chart data from the tubular form (linearized CSV) to STR, which can friendlily reduce the task gap between chart perception and reasoning. We then propose a Structuring Chart-oriented Representation Metric (SCRM) to quantitatively evaluate the chart perception task performance. To augment the training, we further explore the potential of Large Language Models (LLMs) to enhance the diversity in both chart visual style and statistical information. Extensive experiments on various chart-related tasks demonstrate the effectiveness and potential of a unified chart perception-reasoning paradigm to push the frontier of chart understanding.
研究动机与目标
- 通过在单一学习范式下统一感知与推理任务,解决图表感知与推理之间的巨大任务差距。
- 开发一种全面且结构化的评估度量(SCRM),以捕捉图表中的关系型数据信息,克服现有度量的局限性。
- 通过利用大语言模型(LLM)生成具有多样化统计与视觉特性的逼真合成图表,减少对昂贵且人工标注的图表数据的依赖。
- 通过更优的中间表示和数据增强,提升图表理解任务中的零样本与少样本泛化能力。
- 建立一种强大、可扩展且标签高效的范式,适用于多种图表类型及问答之外的下游任务。
提出的方法
- 将图表信息从线性化 CSV(LCT)重构为结构化三元组表示(STR),以 (行, 列, 值) 三元组形式编码数据,从而保留结构与关系信息。
- 基于 STR 设计一种新的评估度量——面向图表的结构化表示度量(SCRM),通过测量结构化数据保真度,定量评估感知质量。
- 开发一种基于大语言模型(LLM)的自我检查数据生成流水线,通过查询统计分布并生成绘图代码(如通过 matplotlib)来合成多样化且逼真的图表。
- 使用所提出的 STR 格式和增强后的 SimChart9K 数据集训练视觉-语言模型,以联合优化感知与推理能力。
- 采用 GPT-3.5 的少样本提示方法评估推理性能,并对比 STR 与 LCT 作为输入表示的表现。
- 在多个基准测试中开展广泛的消融实验与泛化研究:包括 ChartQA、PlotQA 和 Chart2Text,涵盖零样本与少样本设置。
实验结果
研究问题
- RQ1与线性化 CSV(LCT)相比,结构化图表数据表示(STR)是否能显著缩小感知-推理任务差距?
- RQ2所提出的 SCRM 度量是否能有效且定量地评估图表感知性能,超越标准度量?
- RQ3基于大语言模型(LLM)的数据生成是否能提升图表理解模型的泛化能力与少样本性能?
- RQ4StructChart 框架在多样化下游任务(包括问答、摘要生成与重绘)中的表现如何?
- RQ5SimChart9K 合成数据集在多大程度上提升了模型的泛化能力,尤其是在低资源设置下?
主要发现
- 使用 STR 表示的 StructChart 框架在少样本设置下于 ChartQA 上取得 0.8206 的严格 F1 分数(0.2+SimChart9K),优于基线方法,接近在闭源数据集上训练的模型性能。
- 与 LCT 相比,使用 STR 表示可提升 GPT-3.5 在 ChartQA 上的推理性能,高 F1 分数达 0.8002(LCT 为 0.7661),表明其具备更优的结构理解能力。
- SCRM 度量与感知质量具有强相关性,尤其在捕捉关系型数据结构方面,与下游任务性能高度一致。
- SimChart9K 合成数据集显著提升了少样本性能:在 ChartQA0.5+SimChart9K 上,模型取得 0.8380 的高 F1 分数,较仅使用 SimChart9K 的零样本设置相对提升 27%。
- 在零样本评估中,模型在 SimChart9K 上取得 0.2527 的高 F1 分数,表明其能从合成数据中实现强大泛化能力,即使未在真实图表数据上进行微调。
- 定性结果表明,与 LCT 相比,STR 能实现更准确的图表重绘与摘要生成,证实其在保留结构语义方面的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。