[논문 리뷰] Optimal Boxes: Boosting End-to-End Scene Text Recognition by Adjusting Annotated Bounding Boxes via Reinforcement Learning
이 논문은 종합된 텍스트 경계 상자 최적화를 통해 엔드 투 엔드 스트리트 텍스트 인식 성능을 향상시키기 위한 강화 학습 방법인 Box Adjuster를 제안한다. 인식 기반 보상 신호를 사용하여 전경, 배경 및 좌표 특징을 활용해 상자 형상을 조정하는 BoxDQN 에이전트를 훈련시킴으로써, 기준 벤치마크에서 평균 2.0% 향상되고 도메인 적응 작업에서는 4.6% 향상되며, 추론 비용이 전혀 발생하지 않는다.
Text detection and recognition are essential components of a modern OCR system. Most OCR approaches attempt to obtain accurate bounding boxes of text at the detection stage, which is used as the input of the text recognition stage. We observe that when using tight text bounding boxes as input, a text recognizer frequently fails to achieve optimal performance due to the inconsistency between bounding boxes and deep representations of text recognition. In this paper, we propose Box Adjuster, a reinforcement learning-based method for adjusting the shape of each text bounding box to make it more compatible with text recognition models. Additionally, when dealing with cross-domain problems such as synthetic-to-real, the proposed method significantly reduces mismatches in domain distribution between the source and target domains. Experiments demonstrate that the performance of end-to-end text recognition systems can be improved when using the adjusted bounding boxes as the ground truths for training. Specifically, on several benchmark datasets for scene text understanding, the proposed method outperforms state-of-the-art text spotters by an average of 2.0% F-Score on end-to-end text recognition tasks and 4.6% F-Score on domain adaptation tasks.
연구 동기 및 목표
- 텍스트 인식 모델에서 사용하는 딥 레프레젠테이션과 일치하지 않는 타이트한 애너테이션된 텍스트 경계 상자 간의 일관성 문제를 해결하기 위해.
- 최적의 경계 상자 형상을 학습하여 인식 신뢰도를 극대화함으로써 엔드 투 엔드 스트리트 텍스트 인식 성능을 향상시키기 위해.
- 합성 데이터에서 실세계 데이터로의 전이와 같은 교차 도메인 환경에서 도메인 스트레스를 줄이기 위해 기존의 지도 학습 타겟을 정교화하기 위해.
- 추가적인 추론 비용 없이도 일반적인 목적의 훈련 단계 전처리 방법을 개발하기 위해.
- 베지어 곡선 표현을 사용하여 임의의 모양을 가진 텍스트로 이 방법을 확장하기 위해.
제안 방법
- 인식 신뢰도를 극대화하기 위해 상자 좌표(좌표 x, y, 너비, 높이, 회전)를 조정하는 데 목적이 있는 강화 학습 프레임워크인 BoxDQN을 사용한다.
- BoxDQN 에이전트는 전경 이미지 패치, 배경 컨텍스트 및 공간 좌표를 통합하는 특징 융합 모듈(FFM)을 입력으로 사용한다.
- 정책 학습을 이끄는 데 사용하기 위해 사전 훈련된 텍스트 인식기로 인식 기반 보상 신호를 계산한다.
- 이 방법은 추론 시간 동안 적용되지 않으며, 데이터셋 준비 단계에서만 사용되어 런타임 오버헤드가 전혀 발생하지 않는다.
- 임의의 모양을 가진 텍스트의 경우, 고정된 제어점을 갖는 베지어 곡선(8개)을 사용해 가변 길이의 다각형 상자 표현을 가능하게 한다.
- 경험 재생 및 타겟 네트워크를 사용한 DQN 알고리즘을 사용해 BoxDQN을 훈련하며, 초모델은 아블레이션을 통해 튜닝된다.
실험 결과
연구 질문
- RQ1애너테이션된 경계 상자를 조정하는 것으로 엔드 투 엔드 스트리트 텍스트 인식 성능을 타이트한 지도 학습 타겟 상자보다 더 향상시킬 수 있는가?
- RQ2제안된 강화 학습 기반 상자 조정 방법은 합성 데이터에서 실세계 데이터로의 전이 학습에서 도메인 스트레스를 어떻게 줄이는가?
- RQ3상자 조정 에이전트의 최적의 입력 표현은 무엇인가—전경만, 아니면 배경과 좌표까지 포함하는가?
- RQ4BoxDQN이 최적의 상자 조정으로 수렴하기 위해 필요한 훈련 반복 횟수는 몇 개인가?
- RQ5고정된 표현 방식인 베지어 곡선을 사용해 임의의 모양을 가진 텍스트로 이 방법을 확장할 수 있는가?
주요 결과
- 제안된 Box Adjuster는 최첨단 기법들과 비교해 표준 엔드 투 엔드 텍스트 인식 벤치마크에서 평균 F-Score를 2.0% 향상시킨다.
- 합성 데이터에서 실세계 데이터로의 전이 학습과 같은 도메인 적응 작업에서는, 이전 기법들에 비해 F-Score가 상대적으로 4.6% 향상된다.
- 배경 및 좌표 특징을 포함한 특징 융합 모듈(FFM)은 전경 이미지만 사용하는 DQN 대비 F-Score 0.6% 향상된다.
- BoxDQN의 최적 훈련 반복 횟수는 20회이며, 이는 최고의 성능를 달성하면서도 최소한의 계산 비용으로 이루어진다.
- 임의의 모양을 가진 텍스트가 포함된 TotalText 데이터셋에서, 베지어 곡선 표현을 사용할 경우 F-Score는 61.5에서 63.8로 향상된다.
- 아블레이션 연구 결과, 다양한 인식 및 검출 백본에서 동일한 성능 향상이 일관되게 관찰되어, 이 방법이 일반화됨을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.