Skip to main content
QUICK REVIEW

[论文解读] Recognizing Vector Graphics without Rasterization

Xinyang Jiang, Lu Liu|arXiv (Cornell University)|Nov 5, 2021
Advanced Image and Video Retrieval Techniques被引用 11
一句话总结

该论文提出 YOLaT,一种无需卷积神经网络(CNN)且端到端的矢量图形目标检测框架,可直接在未经光栅化的文本矢量描述上运行。通过构建多图以编码结构与空间关系,并采用双流图神经网络,YOLaT 在平均精度上表现更优,且效率显著优于基于光栅化的基线方法,即使在参数量仅为基线模型 25 分之一、浮点运算量(FLOPs)仅为基线模型 100 分之一的情况下,仍能超越在 ImageNet 上预训练的两阶段模型。

ABSTRACT

In this paper, we consider a different data format for images: vector graphics. In contrast to raster graphics which are widely used in image recognition, vector graphics can be scaled up or down into any resolution without aliasing or information loss, due to the analytic representation of the primitives in the document. Furthermore, vector graphics are able to give extra structural information on how low-level elements group together to form high level shapes or structures. These merits of graphic vectors have not been fully leveraged in existing methods. To explore this data format, we target on the fundamental recognition tasks: object localization and classification. We propose an efficient CNN-free pipeline that does not render the graphic into pixels (i.e. rasterization), and takes textual document of the vector graphics as input, called YOLaT (You Only Look at Text). YOLaT builds multi-graphs to model the structural and spatial information in vector graphics, and a dual-stream graph neural network is proposed to detect objects from the graph. Our experiments show that by directly operating on vector graphics, YOLaT out-performs raster-graphic based object detection baselines in terms of both average precision and efficiency.

研究动机与目标

  • 为解决计算机视觉领域中矢量图形研究的不足,特别是针对目标检测任务的研究空白。
  • 克服光栅化带来的局限性,如分辨率损失、内存开销高以及信息退化。
  • 开发一种高效、端到端的检测流程,可直接在矢量图形的文本表示上运行。
  • 保留光栅化过程中会丢失的矢量图形中的结构与空间信息。
  • 证明直接处理矢量数据可实现更精确且高效的对象定位与分类。

提出的方法

  • 将所有矢量原语(线条、曲线、圆形等)转换为统一的文本格式,以实现一致处理。
  • 构建无向多图,利用节点特征与边类型来建模原语之间的空间与结构关系。
  • 提出双流图神经网络:一路处理原语级特征,另一路编码相连节点间的相对位置差异。
  • 采用可学习的聚合函数,结合两路特征,并通过边相关的消息传递机制,提升表征学习效果。
  • 直接从图结构生成对象提议,无需回归操作,从而实现精确的边界框预测。
  • 采用双流图神经网络,结合早期聚合与边属性建模,以增强特征学习,同时最小化过平滑现象与计算成本。

实验结果

研究问题

  • RQ1是否可以在不进行光栅化的情况下有效实现矢量图形中的目标检测,从而保留高分辨率与结构信息?
  • RQ2与基于光栅化的处理方法相比,直接处理文本矢量命令在检测精度与效率方面表现如何?
  • RQ3在双流图神经网络架构中,同时建模原语级特征与相对空间关系,对矢量图形识别有何影响?
  • RQ4当从零开始训练时,基于图神经网络的模型是否能在矢量图形上超越标准的基于卷积神经网络的检测器,即使未使用 ImageNet 预训练?
  • RQ5在复杂图表中,保留细粒度几何细节(如晶体管箭头方向)对检测性能有何影响?

主要发现

  • 在图表数据集上,YOLaT 达到 98.67% 的 mAP,在平面图数据集上达到 95.82% 的 mAP,优于所有基于光栅化的基线模型。
  • 在相同数据集上,YOLaT 的参数量仅为强大 ImageNet 预训练两阶段检测器的 1/25,浮点运算量(FLOPs)仅为后者的 1/100。
  • 消融实验表明,采用基于位置的边特征与特征差异建模的双流图神经网络,相比消融变体,mAP 提升了 2.8%。
  • 可视化结果表明,YOLaT 生成的边界框更紧凑、更精确,能与对象边界完全对齐;而基于光栅化的模型则产生模糊且过度扩展的边界框。
  • YOLaT 成功区分了如晶体管箭头方向等细微几何特征,而这些特征在低分辨率光栅化图像中已丢失。
  • 该方法在复杂矢量图形上展现出更优的泛化能力,检测到更多对象,且在高 IoU 阈值下显著减少误检与漏检,优于 YOLOv3。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。