[논문 리뷰] Rethinking Irregular Scene Text Recognition
이 논문은 곡선 및 임의의 형태의 텍스트에서의 비정규적인 시나리오 텍스트 인식을 재고하며, 곡선 기반 모델의 성능을 크게 향상시키는 실용적인 기법들을 도입한다. 곡선 합성 데이터(CurvedSynth), 임의의 회전을 통한 사각형화, 데이터 혼합 전략, 그리고 TextSnake와 같은 검출기를 통한 이미지 정규화를 활용하여, CUTE-80에서 89.6%의 정확도와 Total-Text에서 76.3%의 정확도를 달성한다. 이는 이전 최고 성능(SOTA)보다 각각 6.3%와 14.7% 향상된 성과이며, ICDAR 2019 ArT 챌린지에서 74.3%의 테스트 정확도로 우승을 차지했다.
Reading text from natural images is challenging due to the great variety in text font, color, size, complex background and etc.. The perspective distortion and non-linear spatial arrangement of characters make it further difficult. While rectification based method is intuitively grounded and has pushed the envelope by far, its potential is far from being well exploited. In this paper, we present a bag of tricks that prove to significantly improve the performance of rectification based method. On curved text dataset, our method achieves an accuracy of 89.6% on CUTE-80 and 76.3% on Total-Text, an improvement over previous state-of-the-art by 6.3% and 14.7% respectively. Furthermore, our combination of tricks helps us win the ICDAR 2019 Arbitrary-Shaped Text Challenge (Latin script), achieving an accuracy of 74.3% on the held-out test set. We release our code as well as data samples for further exploration at https://github.com/Jyouhou/ICDAR2019-ArT-Recognition-Alchemy
연구 동기 및 목표
- 표준 합성 데이터셋인 SynthText 및 Synth90K와 같은 데이터셋에서 곡선 텍스트가 부족하여 발생하는 비정규적인 시나리오 텍스트 인식의 성능 격차를 해소하기 위해.
- 데이터 구성, 사전 처리, 모델 아키텍처, 정규화 전략이 곡선 텍스트 인식에 미치는 영향을 조사하기 위해.
- 시나리오 텍스트 인식에서 일반적인 딥러닝 관행을 재평가함으로써, 임의의 형태의 텍스트에 대한 모델의 일반화 능력과 강건성을 향상시키기 위해.
- 입력 이미지 정규화 또는 검출 기반 사전 처리가 직선 텍스트로 훈련된 모델의 정확도를 크게 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 훈련을 위해 표준 직선 텍스트 합성 데이터를 대체하거나 보완할 수 있도록, 풍부한 곡선 텍스트 인스턴스를 포함한 합성 데이터셋인 CurvedSynth를 제안한다.
- 곡선 텍스트에서의 모델 일반화를 향상시키기 위한 사전 처리 기법으로, 임의의 회전을 통한 사각형화를 도입하여, 회전을 통한 데이터 증강을 가능하게 한다.
- 폴리곤 제어점 기반의 TPS 정규화 모듈과 주목적 기반 RNN 디코더를 갖춘 ResNet+FPN 백본을 사용하는 정규화 기반의 인식 파이프라인을 구현한다.
- 다양한 데이터 혼합 및 아키텍처로 훈련된 다수의 정규화 모델의 투표 앙상블을 적용하여 강건성과 정확도를 향상시킨다.
- 사전 정규화된 입력의 효과를 평가하기 위해, Ground-truth 폴리곤을 사용해 Total-Text 테스트 이미지를 TextSnake로 정규화하여 생성한 새로운 데이터셋인 RectTotal을 활용한다.
- 합성 데이터와 실제 세계 데이터의 균형을 맞추는 데이터 혼합 전략을 구현하며, 실제 데이터의 비중을 총 훈련 데이터의 15%로 설정하여 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1표준 합성 데이터셋 대비 곡선 텍스트를 포함한 합성 데이터로 훈련할 경우, 곡선 텍스트 벤치마크에서 인식 성능이 유의미하게 향상되는가?
- RQ2임의의 회전을 통한 사각형화 전처리 기법이 비정규적이고 곡선 텍스트 인식 성능에 어떤 영향을 미치는가?
- RQ3TextSnake와 같은 사전 훈련된 검출기를 사용해 입력 이미지를 정규화함으로써, 직선 텍스트로 훈련된 모델의 인식 정확도가 향상되는가?
- RQ4임의의 형태의 텍스트를 인식하기 위해 합성 데이터와 실제 세계 데이터 간의 최적의 혼합 비율은 무엇인가?
- RQ5모든 이미지를 고정 크기(예: 64×256)로 리사이징하는 표준 사전 처리 방식이 곡선 텍스트에서 모델 성능을 제한하는가? 변수 크기 입력이 결과를 향상시킬 수 있는가?
주요 결과
- 모델을 그대로 유지한 채 CurvedSynth로 훈련함으로써 CUTE-80에서 89.6%의 정확도를 달성하며, SynthText/Synth90K로 훈련한 경우 대비 6.3% 향상되었다.
- 더 도전적인 Total-Text 데이터셋에서 이 방법은 76.3%의 정확도를 기록하여 이전 최고 성능(SOTA) 대비 14.7% 향상되었다.
- 사각형화, 데이터 혼합, 투표 메커니즘을 통합한 앙상블 시스템은 ICDAR 2019 ArT 챌린지의 공개 테스트 세트에서 74.3%의 정확도를 기록하며 대회에서 우승을 차지했다.
- TextSnake와 Ground-truth 폴리곤을 사용해 테스트 이미지를 사전 정규화함으로써, 직선 텍스트로만 훈련된 모델이 곡선 텍스트에서 유사한 성능을 달성할 수 있었으며, 이는 검출 품질의 중요성을 입증한다.
- 임의의 회전을 통한 사각형화 전처리 기법은 곡선 텍스트에서 성능 향상을 이끌어내며, 직선 텍스트에서는 성능 향상이 미미하지만 효과적인 데이터 증강을 가능하게 한다.
- 연구 결과, 표준 사전 처리(고정 크기 리사이징)와 데이터 구성(예: SynthText만 사용)이 곡선 텍스트 인식에서 강건성을 확보하는 데 주요 장애물임을 밝혀냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.