[论文解读] Chart-to-Text: A Large-Scale Benchmark for Chart Summarization
本文提出 Chart-to-Text,一个包含 44,096 幅图表的大规模基准数据集,涵盖多样化主题与图表类型,旨在推动自动图表摘要技术的发展。该研究提出两种问题变体——使用表格数据或从图像中提取数据——并评估了当前最先进神经模型的表现,揭示了尽管输出流畅,但仍存在幻觉、事实性错误以及难以捕捉复杂视觉模式等挑战。
Charts are commonly used for exploring data and communicating insights. Generating natural language summaries from charts can be very helpful for people in inferring key insights that would otherwise require a lot of cognitive and perceptual efforts. We present Chart-to-text, a large-scale benchmark with two datasets and a total of 44,096 charts covering a wide range of topics and chart types. We explain the dataset construction process and analyze the datasets. We also introduce a number of state-of-the-art neural models as baselines that utilize image captioning and data-to-text generation techniques to tackle two problem variations: one assumes the underlying data table of the chart is available while the other needs to extract data from chart images. Our analysis with automatic and human evaluation shows that while our best models usually generate fluent summaries and yield reasonable BLEU scores, they also suffer from hallucinations and factual errors as well as difficulties in correctly explaining complex patterns and trends in charts.
研究动机与目标
- 为自然语言处理中的图表到文本生成任务解决大规模、多样化数据集缺乏的问题。
- 推动图表自动摘要的研究,该任务对可访问性、洞察发现和信息检索至关重要。
- 通过结合视觉-语言模型(融合图像字幕与数据到文本技术)建立强有力的基线模型。
- 探究图表摘要模型中幻觉、事实性错误与视觉推理方面的挑战。
- 通过发布超参数、训练细节以及多样且符合伦理的数据集,支持可复现的研究。
提出的方法
- 该基准包含两个数据集:一个来自 Statista(20,000 幅图表),另一个来自 Pew Research Center(24,096 幅图表),涵盖多样化主题与图表类型。
- 定义了两种问题变体:(1) 输入为底层数据表格(表格形式),(2) 输入为需通过 OCR 和布局理解提取数据的图表图像。
- 采用当前最先进模型,如 TAB-T5 和视觉编码器模型,结合视觉编码器(如 ViT)与序列到序列文本生成模型(如 T5)。
- 通过 Amazon Mechanical Turk 进行人工标注,遵循严格的伦理准则,提供公平报酬并确保匿名化,以保障数据质量与隐私。
- 评估包括自动指标(BLEU)与人工评估,用于衡量语言流畅性、事实一致性以及关键洞察的覆盖程度。
- 数据集构建过程基于公开可获取的图表,遵循宽松的再利用条款,确保伦理合规性与可复现性。
实验结果
研究问题
- RQ1当可访问底层数据表格时,与必须从图像中提取数据相比,当前最先进模型在从图表生成自然语言摘要方面的表现如何?
- RQ2在缺乏表格数据的情况下,当前模型在图表摘要中产生幻觉或事实性错误的程度如何?
- RQ3模型能否有效捕捉图表中的复杂视觉模式(如趋势、异常值与相关性),还是在感知推理方面存在困难?
- RQ4考虑到基准数据集的多样性,模型在不同图表类型、视觉风格与领域之间的泛化能力如何?
- RQ5当前模型的关键失败模式是什么?未来模型应如何更好地编码图表中的语义与逻辑关系?
主要发现
- 最佳模型生成了语言流畅的摘要,BLEU 分数合理,但经常出现幻觉与事实性错误,尤其在需从图像中提取数据时更为明显。
- 使用底层数据表格的模型(如 TAB-T5)在事实性错误方面显著少于依赖 OCR 和纯图像输入的模型。
- 基于 OCR 的模型难以正确将数据值与图表元素(如将数值错误分配给类别)关联,导致系统性事实性错误。
- 尽管输出流畅,模型常无法解释复杂的视觉模式(如趋势、相关性或异常值),表明其在视觉推理方面存在局限。
- 该基准揭示当前模型在不同图表来源与视觉风格之间泛化能力较差,凸显了对更鲁棒、更多样化训练数据的需求。
- 本研究识别出因输出流畅但错误而导致错误信息传播的严重风险,强调在实际部署中必须进行严格的事实核查。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。