Skip to main content
QUICK REVIEW

[论文解读] Answering Questions about Data Visualizations using Efficient Bimodal Fusion

Kushal Kafle, Robik Shrestha|arXiv (Cornell University)|Aug 5, 2019
Multimodal Machine Learning Applications参考文献 44被引用 4
一句话总结

本文提出PReFIL,一种用于图表问答(CQA)的新颖双模态融合模型,通过并行循环融合机制结合图像与语言特征,实现最先进性能。PReFIL在DVQA与FigureQA数据集上均超越先前方法甚至人类基线,展现出强大的泛化能力,并可通过迭代问答实现表格重建。

ABSTRACT

Chart question answering (CQA) is a newly proposed visual question answering (VQA) task where an algorithm must answer questions about data visualizations, e.g. bar charts, pie charts, and line graphs. CQA requires capabilities that natural-image VQA algorithms lack: fine-grained measurements, optical character recognition, and handling out-of-vocabulary words in both questions and answers. Without modifications, state-of-the-art VQA algorithms perform poorly on this task. Here, we propose a novel CQA algorithm called parallel recurrent fusion of image and language (PReFIL). PReFIL first learns bimodal embeddings by fusing question and image features and then intelligently aggregates these learned embeddings to answer the given question. Despite its simplicity, PReFIL greatly surpasses state-of-the art systems and human baselines on both the FigureQA and DVQA datasets. Additionally, we demonstrate that PReFIL can be used to reconstruct tables by asking a series of questions about a chart.

研究动机与目标

  • 为解决现有VQA模型在理解数据可视化时的局限性,这些局限性包括细粒度测量、OCR处理以及对词汇外术语的处理能力。
  • 开发一个在多种图表类型与问题格式间具有良好泛化能力的稳健CQA系统。
  • 在DVQA与FigureQA等基准CQA数据集上超越最先进性能。
  • 探索利用CQA模型完成下游任务(如从图表自动重建数据表)的可行性。
  • 识别当前数据集的缺陷,并提出更真实、更具挑战性的CQA基准路线图。

提出的方法

  • PReFIL采用图像与语言特征的并行循环融合,学习低层与高层表示中的联合双模态嵌入。
  • 采用双流架构分别编码图像特征(通过CNN)与问题特征(通过RNN),随后通过拼接与门控循环单元实现早期融合。
  • 通过融合嵌入的分层聚合实现多步推理,无需显式注意力或关系模块。
  • 利用预训练的视觉与文本编码器在融合前提取丰富且具有判别力的特征。
  • 对于表格重建,PReFIL使用预定义问题模板进行迭代问答,从图表中提取柱状图数量、标签与数值。
  • 系统在CQA数据集上端到端训练,并使用准确率与F1分数等标准指标进行评估。

实验结果

研究问题

  • RQ1一种简单但有效的双模态融合机制是否能在图表问答任务中超越复杂的基于注意力的模型?
  • RQ2CQA模型在结构化图表理解任务中能在多大程度上超越人类表现?
  • RQ3利用CQA模型进行迭代问答,能否以高保真度从可视化图表中重建出底层数据表?
  • RQ4OCR质量与词汇外术语对CQA性能有何影响?模型能否对这些挑战具备鲁棒性?
  • RQ5当前CQA数据集的关键局限是什么?未来基准应如何更真实地反映现实世界中的图表理解需求?

主要发现

  • PReFIL在DVQA数据集上达到91.14%的准确率,在FigureQA上达到90.88%,显著优于先前最先进方法。
  • 在FigureQA上,PReFIL准确率达到90.88%,超过人类基线的88.5%。
  • 在DVQA上,使用Oracle OCR的PReFIL在所有问题类型中均超越人类表现,在新测试图表上达到91.10%的准确率。
  • 使用算法1进行表格重建,在熟悉图表上达到90.79%的整体准确率,在新图表上达到91.10%,形状预测近乎完美(99.97%)。
  • 当结合高质量OCR时,模型对词汇外术语与复杂推理表现出强鲁棒性。
  • 研究发现OCR质量是关键瓶颈,低质量OCR模型会导致性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。