Skip to main content
QUICK REVIEW

[论文解读] LEAF-QA: Locate, Encode & Attend for Figure Question Answering

Ritwick Chaudhry, Sumit Shekhar|arXiv (Cornell University)|Jul 30, 2019
Multimodal Machine Learning Applications参考文献 29被引用 12
一句话总结

本文提出 LEAF-QA,一个大规模、真实世界的数据集,包含 250,000 张密集标注的图表与 200 万组 QA 对,并提出 LEAF-Net,一种新型架构,能够定位图表元素,以这些元素为基准编码问题与答案,并利用注意力机制实现多模态推理。LEAF-Net 在 FigureQA 和 DVQA 上达到最先进性能,显著优于先前模型,尤其在复杂推理与未登录词答案方面表现突出。

ABSTRACT

We introduce LEAF-QA, a comprehensive dataset of $250,000$ densely annotated figures/charts, constructed from real-world open data sources, along with ~2 million question-answer (QA) pairs querying the structure and semantics of these charts. LEAF-QA highlights the problem of multimodal QA, which is notably different from conventional visual QA (VQA), and has recently gained interest in the community. Furthermore, LEAF-QA is significantly more complex than previous attempts at chart QA, viz. FigureQA and DVQA, which present only limited variations in chart data. LEAF-QA being constructed from real-world sources, requires a novel architecture to enable question answering. To this end, LEAF-Net, a deep architecture involving chart element localization, question and answer encoding in terms of chart elements, and an attention network is proposed. Different experiments are conducted to demonstrate the challenges of QA on LEAF-QA. The proposed architecture, LEAF-Net also considerably advances the current state-of-the-art on FigureQA and DVQA.

研究动机与目标

  • 为解决现有图表 QA 数据集依赖合成数据、词汇量有限且模板固定的局限性,创建一个大规模、真实世界的数据集,涵盖多样化、自然化的问题。
  • 通过从开放的真实世界数据源(如政府人口普查与财务报告)构建数据集,实现稳健、可泛化的图表问答。
  • 开发一种深度学习框架,能够处理未登录词答案并实现对图表元素的复杂推理,突破二元或固定词汇表答案空间的限制。
  • 通过从未见数据源中抽取的新测试集评估模型泛化能力,以模拟真实世界部署中的挑战。

提出的方法

  • LEAF-Net 使用 Mask R-CNN 对图表元素(如标题、坐标轴、图例、数据点)进行定位与分割,输出边界框或掩码。
  • 将问题与答案以检测到的图表元素为基准进行编码,实现自然语言查询对视觉组件的语义定位。
  • 通过注意力机制将局部化元素的视觉特征与编码后的问题与答案表征融合,实现端到端推理。
  • 在 LEAF-QA 上进行训练,通过问题模板的改写(paraphrasing)进行数据增强,防止模板记忆。
  • 评估时,模型在 DVQA 和 FigureQA 上进行微调,使用真实框(ground-truth boxes)与图表特定的字符串编码,同时采用 oracle 和 OCR 基于的文本提取方式。
  • 消融研究评估了元素定位、OCR 准确率与答案编码对整体性能的影响。

实验结果

研究问题

  • RQ1多模态 QA 模型能否在包含多样化、未见词汇与复杂视觉布局的真实世界图表上实现泛化?
  • RQ2与端到端视觉-语言模型相比,图表元素定位与语义编码在提升图表推理能力方面有何优势?
  • RQ3通过改写问题并避免基于模板的数据生成,能在多大程度上提升模型的鲁棒性与泛化能力?
  • RQ4所提出的架构在处理未登录词答案方面表现如何?这是真实世界图表 QA 的关键挑战。

主要发现

  • 在 DVQA 测试集上,LEAF-Net 达到 72.72% 的整体准确率,显著优于先前最先进模型 SANDY(56.48%)
  • 在 FigureQA 数据集上,LEAF-Net 达到 81.15% 的准确率,超越先前最先进模型 CNN+LSTM(56.16%)与 Relation Net(72.54%)
  • 模型在新型测试集上保持高表现(整体准确率 61.33%),证明其对未见数据源具有强大的泛化能力
  • 各类文本元素检测的精确率与召回率均较高,标题与坐标轴标签检测的精确率超过 99%,召回率超过 98%
  • 由于采用了局部化文本提取,LEAF-Net 的 OCR 性能相比先前模型显著提升,仅比 oracle 性能略有下降
  • 消融研究证实,图表元素编码与注意力机制对处理复杂推理与未登录词答案至关重要

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。