[논문 리뷰] Text Perceptron: Towards End-to-End Arbitrary-Shaped Text Spotting
Text Perceptron는 분할 기반 검출기와 미분 가능 형태 변환 모듈(STM)을 통합하여 임의의 형태를 가진 텍스트 스포팅을 위한 엔드 투 엔드 학습 가능한 프레임워크를 제안한다. STM는 투명판 스퍼링 기반 정규화를 위한 가상점들을 동적으로 최적화한다. 이 방법은 Total-Text 및 CTW1500과 같은 비정형 텍스트 벤치마크에서 최신 기술 수준의 성능을 달성하며, 오차 신호를 역전파하여 검출 및 인식을 동시에 최적화함으로써 이전의 파이프라인 또는 비엔드 투 엔드 접근 방식보다 뚜렷이 뛰어난 성능을 발휘한다.
Many approaches have recently been proposed to detect irregular scene text and achieved promising results. However, their localization results may not well satisfy the following text recognition part mainly because of two reasons: 1) recognizing arbitrary shaped text is still a challenging task, and 2) prevalent non-trainable pipeline strategies between text detection and text recognition will lead to suboptimal performances. To handle this incompatibility problem, in this paper we propose an end-to-end trainable text spotting approach named Text Perceptron. Concretely, Text Perceptron first employs an efficient segmentation-based text detector that learns the latent text reading order and boundary information. Then a novel Shape Transform Module (abbr. STM) is designed to transform the detected feature regions into regular morphologies without extra parameters. It unites text detection and the following recognition part into a whole framework, and helps the whole network achieve global optimization. Experiments show that our method achieves competitive performance on two standard text benchmarks, i.e., ICDAR 2013 and ICDAR 2015, and also obviously outperforms existing methods on irregular text benchmarks SCUT-CTW1500 and Total-Text.
연구 동기 및 목표
- 기존의 파이프라인 기반 텍스트 검출 및 인식 간의 부적합성 문제를 해결하여, 비정형 텍스트에서 엔드 투 엔드 최적화 및 강건성을 향상시키기 위해.
- 곡선 또는 다중 방향의 스트리트 텍스트를 처리할 때 고정된 정규화 방법과 비가역적인 가상점 생성 방식의 한계를 극복하기 위해.
- 검출 및 인식을 동시에 최적화할 수 있도록 동적으로 가상점을 조정하는 통합형 학습 가능한 프레임워크를 설계하기 위해.
- 읽기 순서와 경계 구조를 명시적으로 모델링함으로써 임의의 형태를 가진 텍스트의 인식 정확도를 향상시키기 위해.
- 외부 정규화 네트워크가 필요 없도록 하고, 엔드 투 엔드 학습 과정에 정규화를 통합함으로써 계산 비용을 절감하기 위해.
제안 방법
- 각 픽셀을 중심, 머리, 尾, 상하 경계로 분류하는 분할 기반 텍스트 검출기를 설계하여, 학습된 읽기 순서를 가진 텍스트 인스턴스를 검출할 수 있도록 한다.
- 가상점은 미분 가능한 투명판 스퍼링(TPS)을 사용하여 텍스트 경계에서 생성 및 개선되며, 이는 비정형 텍스트를 정규화된 형태로 변환한다.
- 가상점은 인식 헤드에서 역전파된 신호를 통해 동적으로 조정되며, 검출 및 인식 구성 요소의 엔드 투 엔드 최적화를 가능하게 한다.
- 정렬된 특징에서 문자 시퀀스를 생성하기 위해 순서 기반 인식 헤드(CRNN 등)를 사용한다.
- 전체 시스템은 엔드 투 엔드로 학습되며, 인식에서 유도된 오차 신호가 검출 및 가상점 위치를 개선하는 데 기여한다.
- 가상점 수를 4에서 18까지 다양하게 지원하며, 비정형 벤치마크에서 성능이 10~14개 지점에서 안정화됨을 확인하였다.
실험 결과
연구 질문
- RQ1비가역적 파이프라인 접근 방식의 한계를 극복하기 위해, 임의의 형태를 가진 텍스트에 대해 검출 및 인식을 동시에 최적화할 수 있는 미분 가능하고 엔드 투 엔드 프레임워크를 설계할 수 있는가?
- RQ2가상점의 수가 곡선 및 다중 방향 텍스트의 정규화 및 인식 성능에 어떤 영향을 미치는가?
- RQ3구조화된 경계 분류를 갖춘 분할 기반 검출기가 가까이 붙어 있거나 겹치는 텍스트 인스턴스의 검출을 향상시킬 수 있는가?
- RQ4학습 가능한 가상점을 갖춘 미분 가능한 형태 변환 모듈이 비가역적이거나 고정 기하학적 정규화 방법보다 성능이 뛰어나게 되는가?
- RQ5역전파된 인식 오차를 통한 엔드 투 엔드 학습이 기존의 이중 단계 학습 방식보다 검출 및 정규화 성능을 향상시키는가?
주요 결과
- 18개의 가상점으로 ICDAR 2015에서 검출 F-스코어 87.1, Total-Text에서 85.3을 기록하여 정형 및 비정형 텍스트 모두에 대해 뛰어난 일반화 능력을 입증하였다.
- 비정형 벤치마크 CTW1500에서 18개의 가상점으로 엔드 투 엔드 F-스코어 84.5를 달성하여 이전 최신 기술 수준의 방법보다 뚜렷이 뛰어난 성능을 보였다.
- Total-Text 및 CTW1500에서 가상점 수가 증가할수록 성능 향상이 관찰되었으며, 10~14개 지점에서 안정화됨을 확인하여 더 복잡한 형태의 텍스트에는 높은 정밀도의 가상점 표현이 필요함을 시사하였다.
- 4개의 가상점으로도 ICDAR 2015에서 F-스코어 87.1을 기록하여 높은 지점 수와 비교해도 성능 저하가 최소한이었으며, 정형 텍스트에 대해서는 충분한 능력을 갖추고 있음을 확인하였다.
- 실패 분석 결과, 겹치는 텍스트 및 수직 텍스트 인식은 여전히 도전 과제로 남아 있었으며, 주로 훈련 데이터의 표현 한계와 인식 모델의 모호성 때문임을 확인하였다.
- 시각화 결과는 모델이 학습된 가상점을 활용해 읽기 순서를 효과적으로 파악하고 곡선, 투시, 수직 텍스트를 정규화된 형태로 변환함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.