Skip to main content
QUICK REVIEW

[논문 리뷰] FAST: Faster Arbitrarily-Shaped Text Detector with Minimalist Kernel Representation

Zhe Chen, Wang, Jiahao|arXiv (Cornell University)|2021. 11. 03.
Handwritten Text Recognition Techniques참고 문헌 46인용 수 7
한 줄 요약

FAST는 최소한의 커널 표현(MKR)과 GPU 병렬 후처리를 사용하여 실시간으로 정확한 임의의 모양 텍스트 검출기를 제안한다. Total-Text에서 152.8 FPS로 81.6% F-측정치를 달성하며, 이는 이전 방법들보다 속도와 정확도 면에서 모두 뛰어나다. 이 방법은 텍스트 전용 백본(텍스트넷)을 위한 맞춤형 신경망 아키텍처 탐색(NAS)을 활용하여 최소한의 후처리 오버헤드로 효율적인 엔드 투 엔드 GPU 추론을 가능하게 한다.

ABSTRACT

We propose an accurate and efficient scene text detection framework, termed FAST (i.e., faster arbitrarily-shaped text detector). Different from recent advanced text detectors that used complicated post-processing and hand-crafted network architectures, resulting in low inference speed, FAST has two new designs. (1) We design a minimalist kernel representation (only has 1-channel output) to model text with arbitrary shape, as well as a GPU-parallel post-processing to efficiently assemble text lines with a negligible time overhead. (2) We search the network architecture tailored for text detection, leading to more powerful features than most networks that are searched for image classification. Benefiting from these two designs, FAST achieves an excellent trade-off between accuracy and efficiency on several challenging datasets, including Total Text, CTW1500, ICDAR 2015, and MSRA-TD500. For example, FAST-T yields 81.6% F-measure at 152 FPS on Total-Text, outperforming the previous fastest method by 1.7 points and 70 FPS in terms of accuracy and speed. With TensorRT optimization, the inference speed can be further accelerated to over 600 FPS. Code and models will be released at https://github.com/czczup/FAST.

연구 동기 및 목표

  • 기존 텍스트 검출기에서 CPU 기반 후처리로 인한 비효율성, 즉 추론 시간의 최대 30% 소모 문제를 해결하기 위해.
  • 실시간 추론을 가능하게 하는 병렬 처리가 가능한 GPU 우수한 텍스트 표현 방식을 설계하기 위해.
  • 이미지 분류가 아닌 텍스트 검출에 특화된 신경망 아키텍처 탐색(NAS) 파이프라인을 개발하여 더 효과적인 경량 백본을 발견하기 위해.
  • 어려운 임의의 모양 텍스트 벤치마크에서 정확도와 추론 속도 사이의 우수한 트레이드오���을 달성하기 위해.

제안 방법

  • 텍스트 라인을 1채널의 침식 영역과 외곽선 픽셀로 표현하는 최소한의 커널 표현(MKR)을 도입하여, 후처리 단계에서 GPU 병렬 텍스트 확장이 효율적으로 가능하도록 한다.
  • MKR 출력에서 전체 텍스트 인스턴스를 재구성하기 위해 GPU 병렬 텍스트 확장 연산을 적용하여 후처리 시간을 극도로 낮춘다.
  • 텍스트 검출에 특화된 맞춤형 NAS 검색 공간과 보상 함수를 설계하여 일반적인 이미지 분류가 아닌 텍스트 인식 맥락에서의 특징 품질을 최적화한다.
  • 텍스트 검출에 더 효과적인 경량 백본인 TextNet을 탐색하고 구현하여, ImageNet 미사전학습 또는 일반 객체 검출 모델보다 우수한 성능을 발휘한다.
  • TensorRT 추론 최적화를 활용하여 추가로 추론 속도를 향상시켜 V100 GPU에서 배치 크기 8로 600 FPS 이상을 달성한다.

실험 결과

연구 질문

  • RQ1최소한의 커널 표현이 텍스트 검출에서 높은 정확도와 GPU 병렬 후처리를 동시에 가능하게 할 수 있는가?
  • RQ2이미지 분류에서의 전이 학습과 비교해 볼 때, 텍스트 전용 신경망 아키텍처 탐색(NAS) 전략이 검출 성능을 얼마나 향상시키는가?
  • RQ3GPU 병렬 후처리 파이프라인과 텍스트 검출을 위한 맞춤형 백본을 결합했을 때 정확도와 속도에서 어떤 성능 향상이 이루어지는가?
  • RQ4TensorRT를 사용하여 추론 속도를 얼마나 빠르게 개선할 수 있으며, 이로 인해 임의의 모양 텍스트 벤치마크에서 높은 F-측정치를 유지할 수 있는가?

주요 결과

  • FAST-T-448은 Total-Text에서 152.8 FPS로 81.6% F-측정치를 달성하여 이전 최고 속도 기록인 PAN-320보다 F-측정치 1.7포인트 향상되고 속도로 70 FPS 향상되었다.
  • TensorRT 최적화를 통해 FAST-T-448는 배치 크기 8로 634.7 FPS에 도달하여 실질적인 배포 효율성이 뛰어나다는 것을 입증했다.
  • FAST-B-800은 46.0 FPS에서 87.5% F-측정치를 기록하여 실시간 추론를 유지하면서도 PSENet-4s보다 정확도와 FLOPs(87.5% 대비 79.6%, 100.1G 대비 345.9G) 면에서 뚜렷한 우월성을 보였다.
  • Total-Text에서 FAST-T-512는 29.5G FLOPs로 83.5% F-측정치를 달성하여 유사한 FLOPs를 가진 DB-R18(82.8% F-측정치)를 능가했다.
  • FAST-S-512는 9.7M 파라미터로 115.5 FPS에서 84.9% F-측정치를 기록하여 소형 모델 크기임에도 강력한 성능을 보였다.
  • NAS 최적화된 TextNet 백본은 MobileNetV3나 ResNet18보다 텍스트 검출에 더 강력한 특징을 제공하며, 이는 이들 모델이 이 작업을 위해 특별히 설계된 것이 아니기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.