Skip to main content
QUICK REVIEW

[논문 리뷰] Recognizing Vector Graphics without Rasterization

Xinyang Jiang, Lu Liu|arXiv (Cornell University)|2021. 11. 05.
Advanced Image and Video Retrieval Techniques인용 수 11
한 줄 요약

이 논문은 래스터화 없이 텍스트 기반 벡터 기술을 직접 처리하는 CNN 기반의 종단 간 객체 검출 프레임워크인 YOLaT를 제안한다. 구조적 및 공간적 관계를 인코딩하기 위해 다중 그래프를 구성하고 이중 스트림 그래프 신경망을 사용함으로써, 래스터 기반 기준보다 더 높은 평균 정밀도와 현저히 뛰어난 효율성을 달성한다. 파라미터 수가 25배 적고 FLOPs가 100배 적은 YOLaT는 ImageNet 미사전학습된 이단계 모델조차도 능가한다.

ABSTRACT

In this paper, we consider a different data format for images: vector graphics. In contrast to raster graphics which are widely used in image recognition, vector graphics can be scaled up or down into any resolution without aliasing or information loss, due to the analytic representation of the primitives in the document. Furthermore, vector graphics are able to give extra structural information on how low-level elements group together to form high level shapes or structures. These merits of graphic vectors have not been fully leveraged in existing methods. To explore this data format, we target on the fundamental recognition tasks: object localization and classification. We propose an efficient CNN-free pipeline that does not render the graphic into pixels (i.e. rasterization), and takes textual document of the vector graphics as input, called YOLaT (You Only Look at Text). YOLaT builds multi-graphs to model the structural and spatial information in vector graphics, and a dual-stream graph neural network is proposed to detect objects from the graph. Our experiments show that by directly operating on vector graphics, YOLaT out-performs raster-graphic based object detection baselines in terms of both average precision and efficiency.

연구 동기 및 목표

  • 컴퓨터 시각 분야에서 벡터 그래픽스에 대한 연구 부족을 해결하기 위해.
  • 해상도 손실, 높은 메모리 비용, 정보 손실 등의 래스터화의 한계를 극복하기 위해.
  • 벡터 그래픽스의 텍스트 표현을 직접 처리하는 효율적이고 종단 간 검출 파이프라인을 개발하기 위해.
  • 래스터화 과정에서 손실되는 구조적 및 공간적 정보를 유지하기 위해.
  • 직접적인 벡터 처리가 더 정밀하고 효율적인 객체 국소화 및 분류를 가능하게 함을 보여주기 위해.

제안 방법

  • 모든 벡터 프리미티브(선분, 곡선, 원 등)를 일관된 처리를 위한 통합된 텍스트 형식으로 변환한다.
  • 노드 특징과 간선 유형을 사용하여 프리미티브 간의 공간적 및 구조적 관계를 모델링하기 위해 무방향 다중 그래프를 구성한다.
  • 이중 스트림 그래프 신경망을 도입: 한 스트림은 프리미티브 수준의 특징을 처리하고, 다른 스트림은 연결된 노드 간의 상대적 위치 차이를 인코딩한다.
  • 두 스트림의 특징을 결합하는 학습 가능한 집계 함수를 사용하며, 개선된 표현 학습을 위해 간선별 메시지 전파를 구현한다.
  • 회귀 없이도 그래프 구조에서 직접 객체 제안을 생성함으로써 정밀한 바운딩 박스 예측을 가능하게 한다.
  • 초기 집계와 간선 속성 모델링을 통한 이중 스트림 GNN을 활용해 특징 학습을 향상시키면서 과도한 스무딩과 계산 비용을 최소화한다.

실험 결과

연구 질문

  • RQ1래스터화 없이도 고해상도 및 구조적 정보를 유지하면서 벡터 그래픽스에서 객체 검출을 효과적으로 수행할 수 있는가?
  • RQ2래스터화 기반 방법과 비교할 때, 텍스트 기반 벡터 명령어를 직접 처리하는 방식이 검출 정확도와 효율성 측면에서 어떻게 다른가?
  • RQ3이중 스트림 GNN 아키텍처에서 프리미티브 수준의 특징과 상대적 공간 관계를 동시에 모델링할 경우, 벡터 그래픽스 인식에 어떤 영향을 미치는가?
  • RQ4ImageNet 미사전학습 없이 라이트닝된 상태에서 학습된 GNN 기반 모델이 벡터 그래픽스에서 표준 CNN 기반 검출기보다 성능을 뛰어넘을 수 있는가?
  • RQ5복잡한 다이어그램에서 세밀한 기하학적 세부 정보(예: 트anz이스터 화살표 방향)를 유지할 경우 검출 성능에 어떤 영향을 미치는가?

주요 결과

  • YOLaT는 다이어그램 데이터셋에서 98.67% mAP, 플로어플랜 데이터셋에서 95.82% mAP를 기록하여 모든 래스터 기반 기준을 능가한다.
  • 동일한 데이터셋에서 YOLaT는 강력한 ImageNet 미사전학습된 이단계 검출기 대비 파라미터 수가 25배 적고 FLOPs가 100배 적다.
  • 제거 실험을 통해 이중 스트림 GNN이 위치 기반 간선 특징과 특징 차이 모델링을 통합할 경우, 제거된 변종 대비 2.8% mAP 향상이 확인되었다.
  • 시각화 결과 YOLaT는 객체 경계와 정확히 일치하는 더 타이트하고 정밀한 바운딩 박스를 생성하는 반면, 래스터 기반 모델은 정밀도가 떨어지고 과도하게 퍼져 있는 박스를 생성한다.
  • YOLaT는 래스터화된 이미지에서 사라지는 트랜지스터 화살표 방향과 같은 세밀한 기하학적 세부 정보를 정확히 구분할 수 있다.
  • 복잡한 벡터 그래픽스에서 우수한 일반화 성능을 보이며, 특히 고 IoU 임계값에서 YOLOv3보다 더 많은 객체를 검출하고 거짓 음성률을 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.