[论文解读] DePlot: One-shot visual language reasoning by plot-to-table translation
DePlot 引入了一种一次提示(one-shot)视觉语言推理框架,通过端到端的图像到文本 Transformer 模型将图表转换为结构化表格,结合大语言模型(LLMs)后实现最先进性能。在 ChartQA 的人工编写查询上,仅使用一次提示,其性能相比微调后的最先进模型提升了 29.4%。
Visual language such as charts and plots is ubiquitous in the human world. Comprehending plots and charts requires strong reasoning skills. Prior state-of-the-art (SOTA) models require at least tens of thousands of training examples and their reasoning capabilities are still much limited, especially on complex human-written queries. This paper presents the first one-shot solution to visual language reasoning. We decompose the challenge of visual language reasoning into two steps: (1) plot-to-text translation, and (2) reasoning over the translated text. The key in this method is a modality conversion module, named as DePlot, which translates the image of a plot or chart to a linearized table. The output of DePlot can then be directly used to prompt a pretrained large language model (LLM), exploiting the few-shot reasoning capabilities of LLMs. To obtain DePlot, we standardize the plot-to-table task by establishing unified task formats and metrics, and train DePlot end-to-end on this task. DePlot can then be used off-the-shelf together with LLMs in a plug-and-play fashion. Compared with a SOTA model finetuned on more than >28k data points, DePlot+LLM with just one-shot prompting achieves a 24.0% improvement over finetuned SOTA on human-written queries from the task of chart QA.
研究动机与目标
- 解决现有视觉语言推理模型依赖数千个微调样本的局限性,并在复杂人工编写查询上表现不佳的问题。
- 通过将图表理解解耦为图表到表格的转换与后续基于大语言模型的推理,实现少样本视觉语言推理。
- 通过一种对行/列排列不变且对相对数值误差具有容错性的统一评估指标,标准化图表到表格的任务。
- 开发一种即插即用的模态转换模块 DePlot,无需特定任务的工程设计即可跨多种图表类型泛化。
- 证明通过基于表格的提示策略利用大语言模型,可显著减少监督需求,从而超越端到端微调模型的性能。
提出的方法
- DePlot 是一种端到端的图像到文本 Transformer 模型,通过合成数据与网络爬取的图表-表格配对混合语料进行训练,将视觉图表转换为线性化文本表格。
- 该模型被训练为生成保留输入图表中文本和数值内容的结构化、表格化文本表示。
- 提出一种新颖的表格相似性度量指标 RMS_F1,用于评估图表到表格的转换,该指标具备相对误差容错性,并对行/列排列保持不变。
- DePlot 的输出作为输入提供给预训练的大语言模型,并结合少样本提示技术(如思维链 CoT 和思维程序 PoT)进行推理。
- 该框架分为两个阶段:(1) 通过 DePlot 进行图表到表格的转换;(2) 使用少样本提示技术,基于大语言模型对生成的表格进行推理。
- 该方法在 ChartQA 和 PlotQA 上进行评估,并通过消融研究和分布外分析评估其鲁棒性与失效模式。
实验结果
研究问题
- RQ1一个统一的端到端图表到表格转换模型,是否能在准确率和跨图表类型的泛化能力上超越混合式、基于规则的系统?
- RQ2在准确的表格转换支持下,仅使用一次提示策略的大语言模型,是否能在复杂人工编写查询上超越完全监督的最先进模型?
- RQ3如何设计一种稳健且不变的度量指标,以公平评估图表到表格的转换,同时考虑结构与数值上的变化?
- RQ4DePlot 在训练中未见过的域外图表(如来自不同来源或工具的图表)上泛化能力如何,尤其在跨工具或跨数据源场景下?
- RQ5DePlot 的主要失效模式是什么?视觉属性(如颜色或方向)如何影响转换的准确性?
主要发现
- 在 ChartQA 基准测试中,尽管仅使用一次提示监督,DePlot 在人工编写查询上的性能相比之前最先进模型实现了 29.4% 的绝对提升。
- DePlot + 大语言模型框架的表现优于需要数千个微调样本的完全监督最先进模型,证明了在准确表格转换支持下,少样本提示策略的强大优势。
- 在图表到表格转换任务中,DePlot 显著优于基于 OCR 的基线模型及其他端到端模型,尤其在统一处理多样化图表类型方面表现突出。
- 在 TaTa 数据集中的分布外图表上,DePlot 的平均 RMS_F1 得分为 78%,表明其具备中等程度的泛化能力,但对附加标签和相邻文本处理存在困难。
- 失效案例主要源于视觉干扰(如参考文献、脚注)以及箭头连接的标签,提示需改进数据预处理与训练数据的鲁棒性。
- 本研究发现,将颜色和方向等视觉属性编码进解码目标可进一步提升性能,为未来工作指明了有前景的方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。