Skip to main content
QUICK REVIEW

[论文解读] ChartDETR: A Multi-shape Detection Network for Visual Chart Recognition

Wenyuan Xue, Dapeng Chen|arXiv (Cornell University)|Aug 15, 2023
Handwritten Text Recognition TechniquesComputer Science被引用 3
一句话总结

ChartDETR 是一种基于 Transformer 的多形状检测网络,通过查询组和关键点集预测,在单次前向传播中直接预测图表图像中的所有数据元素形状,无需后处理。它在 Adobe Synthetic 上实现了 0.98 的 SOTA F1 分数,在 ExcelChart400k 上实现了 0.97 的 SOTA F1 分数,通过直接回归条形图、折线图和饼图的关键点,无需额外的设计或分组启发式规则。

ABSTRACT

Visual chart recognition systems are gaining increasing attention due to the growing demand for automatically identifying table headers and values from chart images. Current methods rely on keypoint detection to estimate data element shapes in charts but suffer from grouping errors in post-processing. To address this issue, we propose ChartDETR, a transformer-based multi-shape detector that localizes keypoints at the corners of regular shapes to reconstruct multiple data elements in a single chart image. Our method predicts all data element shapes at once by introducing query groups in set prediction, eliminating the need for further postprocessing. This property allows ChartDETR to serve as a unified framework capable of representing various chart types without altering the network architecture, effectively detecting data elements of diverse shapes. We evaluated ChartDETR on three datasets, achieving competitive results across all chart types without any additional enhancements. For example, ChartDETR achieved an F1 score of 0.98 on Adobe Synthetic, significantly outperforming the previous best model with a 0.71 F1 score. Additionally, we obtained a new state-of-the-art result of 0.97 on ExcelChart400k. The code will be made publicly available.

研究动机与目标

  • 解决在统一框架中检测多样化图表形状(条形图、折线图、饼图)且无需后处理的挑战。
  • 通过消除对手动设计的后处理规则的需求,克服基于关键点方法中的分组错误。
  • 通过使用查询组进行集合预测,实现在端到端方式下检测多个数据元素。
  • 在不修改网络架构的前提下,实现对各种图表类型的高精度检测。
  • 提供一种简单但有效的解决方案,可在不同图表类型和视觉外观之间实现良好泛化。

提出的方法

  • ChartDETR 使用基于 Transformer 的集合预测框架,并引入查询组,以同时预测多个数据元素形状。
  • 每种形状由 N 个关键点表示,模型通过 M 个查询组总共预测 M×N 个关键点,每个查询组负责检测一种形状。
  • 采用重复关键点匹配策略,将真实标注的关键点插值以匹配预测的 N 个点,从而实现逐点监督。
  • 模型在预测的关键点组与真实标注形状之间采用二分图匹配损失,以确保正确对应。
  • 采用包含 K 个重复真实标注实例的混合一对一至多对多匹配方案,提升训练稳定性和性能。
  • 该方法与网络架构无关,可与多种主干网络(包括 ResNet、Swin 和 HRNet)配合使用,具备灵活性和可扩展性。

实验结果

研究问题

  • RQ1统一的深度学习框架能否在不修改架构或后处理的前提下,检测多种图表类型(条形图、折线图、饼图)?
  • RQ2在空间布局复杂的图表中,与单查询检测器相比,查询分组在多形状检测中如何提升性能?
  • RQ3重复关键点匹配和二分图匹配在多大程度上提升了关键点定位精度并减少了误报?
  • RQ4在多样化图表数据集上实现鲁棒检测时,N(每种形状的关键点数)和 M(最大形状数)的最佳配置是什么?
  • RQ5采用 K 个重复真实标注实例的一对多匹配策略如何影响模型收敛性和性能?

主要发现

  • 在 Adobe Synthetic 数据集上,ChartDETR 达到了 0.98 的 F1 分数,显著优于之前最佳模型(0.71 F1)。
  • 在 ExcelChart400k 基准测试中,ChartDETR 实现了新的 SOTA F1 分数 0.97,证明其在真实世界图表图像中具有强大的泛化能力。
  • 消融实验表明,在 Adobe Synthetic 上,设置 N=14(默认值)和 M=8 时性能最佳,进一步增加 M 或 N 反而导致性能下降。
  • 采用 K=3 的一对多匹配方案提供了最高的性能增益,相比仅使用一对一匹配,F1 提升了 0.029。
  • HRNet 主干网络在条形图检测中表现优于 ResNet 和 Swin 变体,达到 0.923 的 F1 分数,表明高分辨率特征图对检测小而密集的条形图至关重要。
  • 该方法在不修改架构的前提下,对所有图表类型均保持一致的高性能,证明了其鲁棒性和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。