Skip to main content
QUICK REVIEW

[논문 리뷰] KISS: Keeping It Simple for Scene Text Recognition

Christian Bartz, Joseph Bethge|arXiv (Cornell University)|2019. 11. 19.
Handwritten Text Recognition Techniques참고 문헌 40인용 수 7
한 줄 요약

KISS는 2D-주의나 이미지 정규화와 같은 전용 레이어 없이, 오직 표준 신경망 구성 요소—두 개의 ResNet-18 특징 추출기, 공간 변환기, 그리고 트랜스포머—만을 사용하여 최신 기술 수준 또는 경쟁 가능한 성능을 달성하는 장면 텍스트 인식 모델을 제안한다. 합성 데이터에서 끝에서 끝까지 끝내기 위해 훈련된 KISS는 단순성과 모oduularity가 장면 텍스트 인식에서 높은 정확도를 이끌 수 있음을 보여준다.

ABSTRACT

Over the past few years, several new methods for scene text recognition have been proposed. Most of these methods propose novel building blocks for neural networks. These novel building blocks are specially tailored for the task of scene text recognition and can thus hardly be used in any other tasks. In this paper, we introduce a new model for scene text recognition that only consists of off-the-shelf building blocks for neural networks. Our model (KISS) consists of two ResNet based feature extractors, a spatial transformer, and a transformer. We train our model only on publicly available, synthetic training data and evaluate it on a range of scene text recognition benchmarks, where we reach state-of-the-art or competitive performance, although our model does not use methods like 2D-attention, or image rectification.

연구 동기 및 목표

  • 특수한 작업용 아키텍처가 아닌 오직 표준적이고 재사용 가능한 신경망 구성 요소에 의존하는 장면 텍스트 인식 모델을 개발하는 것.
  • 2D-주의, 이미지 정규화 또는 미세조정과 같은 특수 기법을 사용하지 않고 최신 기술 수준 또는 경쟁 가능한 성능를 달성하는 것.
  • 기존 구성 요소로 구성된 단순하고 모듈러한 아키텍처가 복잡한 작업 전용 모델을 능가하거나 이를 따라잡을 수 있는지 조사하는 것.
  • 부정성 연구를 통해 모델 내 개별 구성 요소의 중요성을 평가하는 것.
  • 공개적으로 이용 가능한 합성 훈련 데이터와 끝에서 끝까지 훈련을 통해 장면 텍스트 인식에서 높은 성능를 달성할 수 있음을 보여주는 것.

제안 방법

  • 모델은 입력 단어 이미지의 영역에 대해 아핀 변환 행렬을 예측하는 두 개의 독립적인 ResNet-18 특징 추출기를 사용한다: 하나는 국소화용, 다른 하나는 인식용.
  • 국소화 네트워크는 입력 단어 이미지의 관심 영역(ROIs)에 대한 아핀 변환 행렬을 예측한다.
  • 공간 변환기는 이러한 행렬을 사용하여 입력 이미지에서 ROIs를 자르고 정규화한다.
  • 자른 ROIs는 트랜스포머를 사용하여 전체 문자 시퀀스를 예측하는 인식 네트워크에 입력된다.
  • 전체 시스템은 단어 수준의 애너테이션만을 사용하고 진짜 바운딩 박스 없이 끝에서 끝까지 훈련 가능하다.
  • 모델은 데이터 증강이나 미세조정 없이 공개된 합성 데이터셋에서 처음부터 훈련된다.

실험 결과

연구 질문

  • RQ12D-주의나 이미지 정규화와 같은 특수한 구성 요소 없이도 장면 텍스트 인식 모델이 최신 기술 수준의 성능를 달성할 수 있는가?
  • RQ2장면 텍스트 인식에서 높은 정확도를 확보하기 위해 2D-주의나 이미지 정규화와 같은 특수 구성 요소가 반드시 필요한가?
  • RQ3데이터 증강과 다양한 훈련 데이터는 모델 성능에 얼마나 중요한가?
  • RQ4각 아키텍처 구성 요소(예: 트랜스포머, 공간 변환기, 국소화 네트워크)가 전체 성능에 기여하는 비율은 어떠한가?
  • RQ5정답 레이블을 전방향 전파 중에 주입하지 않고도 트랜스포머 기반 국소화 헤드를 효과적으로 훈련시킬 수 있으며, 이는 성능 향상에 기여하는가?

주요 결과

  • KISS 모델은 2D-주의나 이미지 정규화를 사용하지 않아도 여러 표준 장면 텍스트 인식 벤치마크에서 최신 기술 수준 또는 경쟁 가능한 성능를 달성한다.
  • 국소화 네트워크의 LSTM을 트랜스포머로 대체하는 것은 성능 향상에 기여하지 않으며 훈련 시간을 증가시킨다. 이는 현재 단계에서 이점이 제한적임을 시사한다.
  • 인식 헤드에 트랜스포머를 사용하면 단순한 소프트맥스 분류기보다 성능이 크게 향상되며, 이는 주로 어텐션을 활용한 시퀀스-투-시퀀스 모델링의 중요성을 확인한다.
  • 인식 네트워크의 트랜스포머 레이어 수를 늘려도 성능 향상이 없으며, 이는 단일 트랜스포머 레이어로도 충분함을 시사한다.
  • 국소화 네트워크를 제거하고 직접 자른 ROIs를 인식 네트워크에 입력하는 경우, 집중되지 않은 텍스트나 곡선 텍스트에서 성능이 떨어지므로, 적응형 ROI 선택의 가치를 확인한다.
  • 데이터 증강은 일부 데이터셋에서는 강력한 성능 향상에 기여하지만, 다른 데이터셋에서는 영향이 미미하여 데이터셋에 따라 민감도가 다름을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.