[논문 리뷰] Arbitrary Shape Scene Text Detection with Adaptive Text Region Representation
이 논문은 반복 신경망(RNN)을 사용하여 가변적인 텍스트 영역 표현을 도입함으로써, 경계점들을 반복적으로 예측하여 임의의 모양을 가진 텍스트 영역을 탐지하는 새로운 시나리오 텍스트 검출 방법을 제안한다. 이 방법은 CTW1500 및 MSRA-TD500와 같은 곡선 텍스트 및 다중 방향 텍스트 데이터셋을 포함한 다섯 개의 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.
Scene text detection attracts much attention in computer vision, because it can be widely used in many applications such as real-time text translation, automatic information entry, blind person assistance, robot sensing and so on. Though many methods have been proposed for horizontal and oriented texts, detecting irregular shape texts such as curved texts is still a challenging problem. To solve the problem, we propose a robust scene text detection method with adaptive text region representation. Given an input image, a text region proposal network is first used for extracting text proposals. Then, these proposals are verified and refined with a refinement network. Here, recurrent neural network based adaptive text region representation is proposed for text region refinement, where a pair of boundary points are predicted each time step until no new points are found. In this way, text regions of arbitrary shapes are detected and represented with adaptive number of boundary points. This gives more accurate description of text regions. Experimental results on five benchmarks, namely, CTW1500, TotalText, ICDAR2013, ICDAR2015 and MSRATD500, show that the proposed method achieves state-of-the-art in scene text detection.
연구 동기 및 목표
- 기존 방법이 여전히 어려움을 겪는 곡선형 또는 다중 방향 텍스트와 같은 임의의 형태의 시나리오 텍스트를 탐지하는 과제를 해결한다.
- 고정된 경계 상자 대신 유연하고 길이가 변하는 경계점 표현을 사용하여 비정상적인 텍스트 영역의 탐지 정확도를 향상시킨다.
- 다양한 실제 환경 조건, 예를 들어 다양한 조명, 언어, 텍스트 길이를 고려한 시나리오 텍스트의 효율적이고 정확한 탐지 가능성을 확보한다.
- 고성능을 유지하면서도 높은 추론 속도를 확보하여 여러 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.
제안 방법
- 입력 이미지에서 초기 텍스트 제안을 생성하기 위해 텍스트 영역 제안 네트워크(Text-RPN)를 사용한다.
- 세 가지 분지(텍스트/비텍스트 분류, 경계 상자 회귀, RNN 기반의 가변적 경계점 예측)를 포함하는 보완 네트워크를 사용하여 제안을 개선한다.
- 각 타임스텝에서 RNN이 한 쌍의 경계점을 예측하고 정지 신호가 생성될 때까지 반복함으로써, 임의의 형태의 텍스트 영역에 대해 길이가 변하는 표현 방식을 가능하게 한다.
- 각 텍스트 제안에 대해 CNN 기반 네트워크에서 추출한 특징 맵을 ROI 풀링을 통해 추출하여 보완 네트워크에 입력함으로써 정확한 국소화를 달성한다.
- 분류, 국소화, 가변적 경계점 생성을 동시에 최적화하는 다중 작업 학습을 통해 모델을 종단 간(end-to-end)으로 훈련시킨다.
- 유연하고 정밀한 곡선 및 비정상적인 형태의 모델링이 가능한, 가변적인 쌍의 경계점 수를 사용하여 탐지된 텍스트 영역를 표현한다.
실험 결과
연구 질문
- RQ1고정된 경계 상자 표현에 비해 RNN 기반의 가변적 경계점 예측 메커니즘이 임의의 형태의 시나리오 텍스트 탐지 정확도를 향상시키는가?
- RQ2CTW1500 및 MSRA-TD500와 같이 곡선형 및 다중 방향 텍스트가 어려운 벤치마크에서 제안된 방법의 성능은 어떠한가?
- RQ3비정상적인 텍스트 탐지에서 최신 기술 수준(SOTA) 정확도를 확보하면서도 고속 추론 속도를 유지할 수 있는가?
- RQ4다양한 시나리오 텍스트 상황, 예를 들어 다국어, 긴 텍스트 라인, 저조도 조건 등에 대해 가변적 표현 전략이 잘 일반화되는가?
주요 결과
- CTW1500 벤치마크에서 제안된 방법은 평균 H-mean 78.5%를 달성하여 이전 최신 기술 수준(SOTA) 방법인 TextSnake(78.4%) 및 Mask Textspotter(78.4%)를 초월한다.
- MSRA-TD500 데이터셋에서 방법은 H-mean 83.6%를 기록하여 이전 모든 방법을 뛰어넘었으며, InceptText(83.0%) 및 MCN(83.0%)를 포함한 모든 이전 방법보다 뛰어나다.
- ICDAR2013에서 방법은 H-mean 91.7%를 달성하여 단일 스케일, 단일 모델 평가 조건에서 최고 성능을 보인 Mask Textspotter와 동일한 성능을 보였다.
- ICDAR2015에서 방법은 H-mean 87.6%를 기록하여 두 번째로 높은 순위를 차지하였으며, 엔드 투 엔드 탐지 및 인식 훈련을 사용하는 FOTS를 제외한 대부분의 방법보다 뛰어났다.
- 720×720 입력에서 방법은 10.0 fps로 실행되며, TextSnake(1.1 fps) 및 Mask Textspotter(6.9 fps)보다 훨씬 빠르며, 픽셀 단위 예측을 피하기 때문이다.
- 정성적 결과는 곡선 텍스트, 다국어 콘텐츠, 긴 텍스트 라인, 다양한 조명 조건 등 다양한 시나리오에서 뛰어난 성능을 보임을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.