[논문 리뷰] Recurrent Calibration Network for Irregular Text Recognition
이 논문은 불규칙한 시나리오 텍스트 인식을 위한 순환 캘리브레이션 네트워크(RCN)를 제안한다. 이는 반복적으로 기준점 좌표를 보정하고 원본 이미지에서 샘플링하여 문자의 무결성을 유지하면서 왜곡된 텍스트를 점진적으로 보정한다. 이 방법은 곡선 및 다중 방향 텍스트 벤치마크에서 특히 최신 기술 수준(SOTA) 성능을 달성하며, CUTE80에서 이전 최고 성능 방법보다 최대 9个百分点 향상된다.
Scene text recognition has received increased attention in the research community. Text in the wild often possesses irregular arrangements, typically including perspective text, curved text, oriented text. Most existing methods are hard to work well for irregular text, especially for severely distorted text. In this paper, we propose a novel Recurrent Calibration Network (RCN) for irregular scene text recognition. The RCN progressively calibrates the irregular text to boost the recognition performance. By decomposing the calibration process into multiple steps, the irregular text can be calibrated to normal one step by step. Besides, in order to avoid the accumulation of lost information caused by inaccurate transformation, we further design a fiducial-point refinement structure to keep the integrity of text during the recurrent process. Instead of the calibrated images, the coordinates of fiducial points are tracked and refined, which implicitly models the transformation information. Based on the refined fiducial points, we estimate the transformation parameters and sample from the original image at each step. In this way, the original character information is preserved until the final transformation. Such designs lead to optimal calibration results to boost the performance of succeeding recognition. Extensive experiments on challenging datasets demonstrate the superiority of our method, especially on irregular benchmarks.
연구 동기 및 목표
- 제약 없는 환경에서 심하게 왜곡된 불규칙한 텍스트, 예를 들어 곡선, 투시, 다중 방향 텍스트 인식의 과제를 해결하기 위해.
- 정확하지 않은 왜곡으로 인해 문자 정보를 잃는 단일 단계 공간 변환의 한계를 극복하기 위해.
- 왜곡을 점진적으로 보정하면서 원본 이미지의 세부 정보를 유지하는 순환 캘리브레이션 메커니즘을 설계하기 위해.
- 보정과 인식을 종합적으로 최적화하여 인식 성능을 향상시키기 위해 엔드 투 엔드 방식으로 통합 최적화를 수행하기 위해.
- 높은 정확도를 유지하면서 추가 애너테이션이나 복잡한 다중 작업 학습을 필요로 하지 않도록 하기 위해.
제안 방법
- RCN는 반복적으로 기하학적 변환을 보정하기 위해 순환 구조를 사용하며, 연속적인 캘리브레이션 단계 간 잔차 변환을 추정한다.
- 변환된 이미지를 전파하는 대신, 반복 과정에서 기준점 좌표를 추적하고 보정하여 정보 손실을 방지한다.
- 각 단계에서 보정된 기준점 좌표는 원본 입력 이미지로 매핑되며, 문자 세부 정보를 유지하기 위해 직접 원본 이미지에서 특징을 샘플링한다.
- 보정 네트워크는 인식 네트워크와 공유된 인식 목표 함수를 사용하여 함께 훈련되며, 엔드 투 엔드 최적화를 가능하게 한다.
- 지역화 네트워크는 이전 기준점에 대한 좌표 오프셋을 예측하여 암묵적으로 잔차 공간 변환을 모델링한다.
- 공간 왜곡을 위해 투명판 스퍼링(TPS) 변환을 사용하며, 각 반복 단계에서 보정된 기준점 좌표로부터 매개변수를 추정한다.
실험 결과
연구 질문
- RQ1순환 캘리브레이션 메커니즘이 심하게 왜곡된 불규칙한 텍스트에서 인식 성능을 향상시킬 수 있는가?
- RQ2변환된 이미지를 전파하는 대신 기준점 좌표를 추적함으로써 반복적 캘리브레이션 중 정보 손실을 줄일 수 있는가?
- RQ3보정과 인식을 엔드 투 엔드로 함께 최적화하면 별도 최적화보다 성능 향상이 가능한가?
- RQ4곡선 및 다중 방향 텍스트에서 이 방법은 단일 단계 공간 변환 방법보다 어떻게 비교되는가?
- RQ5이 방법은 경계 상자나 어휘와 같은 추가 애너테이션 없이도 뛰어난 성능을 달성할 수 있는가?
주요 결과
- SVT에서 88.6%, IIIT5k에서 94.0%, CUTE80에서 88.5%의 정확도를 달성하여 이전 방법보다 뚜렷이 뛰어나며, 특히 곡선 텍스트에서 뛰어난 성능을 보였다.
- CUTE80에서 이전 최고 성능 방법보다 9个百分点 향상되어 심하게 왜곡된 텍스트에서 강력한 성능을 입증했다.
- Total-Text(다중 방향)에서 76.3%의 정확도, Total-Text(곡선)에서 66.7%의 정확도를 기록했으며, 각각 새로운 SOTA 결과였다.
- IC03 및 IC13과 같은 정규 벤치마크에서도 경쟁력 있는 성능를 보여, 다양한 텍스트 유형에 대한 강건성을 입증했다.
- 제거된 기준점 보정 실험(RCN-3 w/o FP-R)에서 CUTE80에서 정확도가 1.1% 감소함으로써, 기준점 보정의 중요성을 확인했다.
- 기타 방법이 문자 경계 상자나 대규모 어휘에 의존하는 것과 달리, 추가 파라미터나 애너테이션 없이도 높은 성능를 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.