Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient and Accurate Arbitrary-Shaped Text Detection with Pixel Aggregation Network

Wenhai Wang, Enze Xie|arXiv (Cornell University)|2019. 08. 16.
Handwritten Text Recognition Techniques참고 문헌 56인용 수 75
한 줄 요약

PAN은 경량 세분화 헤드와 학습 가능한 Pixel Aggregation 후처리를 통해 임의 모양의 텍스트를 탐지하며, 곡선 텍스트 벤치마크에서 실시간에서 거의 실시간 속도에 근접한 속도와 함께 강한 정확도를 달성합니다.

ABSTRACT

Scene text detection, an important step of scene text reading systems, has witnessed rapid development with convolutional neural networks. Nonetheless, two main challenges still exist and hamper its deployment to real-world applications. The first problem is the trade-off between speed and accuracy. The second one is to model the arbitrary-shaped text instance. Recently, some methods have been proposed to tackle arbitrary-shaped text detection, but they rarely take the speed of the entire pipeline into consideration, which may fall short in practical applications.In this paper, we propose an efficient and accurate arbitrary-shaped text detector, termed Pixel Aggregation Network (PAN), which is equipped with a low computational-cost segmentation head and a learnable post-processing. More specifically, the segmentation head is made up of Feature Pyramid Enhancement Module (FPEM) and Feature Fusion Module (FFM). FPEM is a cascadable U-shaped module, which can introduce multi-level information to guide the better segmentation. FFM can gather the features given by the FPEMs of different depths into a final feature for segmentation. The learnable post-processing is implemented by Pixel Aggregation (PA), which can precisely aggregate text pixels by predicted similarity vectors. Experiments on several standard benchmarks validate the superiority of the proposed PAN. It is worth noting that our method can achieve a competitive F-measure of 79.9% at 84.2 FPS on CTW1500.

연구 동기 및 목표

  • 임의 모양의 장면 텍스트 탐지에서의 속도-정확도 트레이드오프를 해결한다.
  • 다중 스케일 특징을 강화하기 위한 경량 세분화 헤드를 개발한다.
  • 학습된 유사도 벡터를 사용하여 텍스트 픽셀을 커널과 병합하는 Pixel Aggregation을 도입한다.
  • 완전한 텍스트 인스턴스를 재구성하기 위한 엔드-투-엔드의 효율적인 후처리를 가능하게 한다.
  • 실시간 속도와 함께 곡선 텍스트 벤치마크에서 최첨단 성능을 입증한다.

제안 방법

  • 세분화를 위한 경량 백본으로 ResNet-18을 사용한다.
  • 저비용으로 수용 영역을 확장하는 cascaded Feature Pyramid Enhancement Module (FPEM)을 도입한다.
  • 최종 세분화 특징으로 다중 깊이 특징을 융합하기 위한 Feature Fusion Module (FFM)을 사용한다.
  • 각 픽셀에 대해 텍스트 영역, 커널, 유사도 벡터를 예측한다.
  • 학습된 유사도 벡터를 사용하여 텍스트 픽셀을 해당 커널로 안내하는 Pixel Aggregation (PA)을 적용한다.
  • 텍스트/커널 손실과 Pixel Aggregation 손실(L_agg, L_dis)의 조합으로 학습하고 세분화에 다이스 손실을 사용한다.

실험 결과

연구 질문

  • RQ1경량 세분화 헤드(FPEM + FFM)가 임의 모양 텍스트 탐지에서 높은 속도를 유지하면서 성능 차이를 좁힐 수 있는가?
  • RQ2Pixel Aggregation이 커널에서 실시간으로 전체 텍스트 인스턴스의 정확한 재구성을 가능하게 하는가?
  • RQ3PA 및 FPEM의 cascade 깊이가 곡선 텍스트 및 다방향 벤치마크에서 정확도와 처리량에 어떤 영향을 미치는가?
  • RQ4CTW1500, Total-Text 및 기타 벤치마크에서 F-measure와 FPS 측면에서 PAN이 최첨단 방법과 어떻게 비교되는가?

주요 결과

  • PAN은 곡선 텍스트 벤치마크(CTW1500 및 Total-Text)에서 최첨단 F-스 measure에 비견되는 성능을 달성하면서도 높은 FPS를 실현한다(예: 외부 사전학습 없이 PAN-320은 CTW1500에서 약 84.2 FPS; PAN-640은 CTW1500에서 약 39.8 FPS).
  • cascade된 FPEM은 최소한의 추가 비용으로 특징 표현을 개선하며, 두 개의 cascade된 FPEM이 속도/정확도 균형을 우수하게 제공한다.
  • FFM은 다중 깊이 특징을 저오버헤드로 효과적으로 융합하여 정확도에서 단순 연결(concatenation)보다 우수한 성능을 보여주면서도 속도는 유사하다.
  • Pixel Aggregation(PA)은 학습된 유사도 벡터를 통해 텍스트 픽셀을 커널에 정렬시켜 정확도를 향상시키며, PA를 제거했을 때 유의미한 게 있음을 확인하는 근거가 있다(배치 연구에서 감소가 관찰됨).
  • SynthText 사전학습을 활용하면 성능이 더욱 향상된다(예: PAN-320 F가 CTW1500에서 약 79.9%; PAN-640은 Total-Text에서 최대 85.0% F를 달성).
  • PAN은 곡선 텍스트에서 강력한 성능을 보여주면서 실시간 또는 거의 실시간 속도로 동작하며, CTW1500, Total-Text, ICDAR 2015 및 MSRA-TD500에서 정확도와 속도 면에서 여러 기준선보다 우수한 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.