[논문 리뷰] Scene Text Recognition via Transformer
이 논문은 이미지 정규화를 생략하고 컨볼루션 특징 맵을 직접 트랜스포머 인코더의 입력으로 사용함으로써 임의의 형태를 띤 텍스트를 다룰 수 있도록 하는 트랜스포머 기반의 장면 텍스트 인식 방법을 제안한다. 공간 주의 메커니즘을 활용하여 정규화가 필요 없음을 입증하며, CUTE 데이터셋에서 99.3%의 정확도를 달성하여 이전 최고 성능(SoA)인 89.6%를 뛰어넘었다. 이는 정규화 과정이 불필요하며, 주의 메커니즘만으로도 최고 수준의 성능을 달성할 수 있음을 시사한다.
Scene text recognition with arbitrary shape is very challenging due to large variations in text shapes, fonts, colors, backgrounds, etc. Most state-of-the-art algorithms rectify the input image into the normalized image, then treat the recognition as a sequence prediction task. The bottleneck of such methods is the rectification, which will cause errors due to distortion perspective. In this paper, we find that the rectification is completely unnecessary. What all we need is the spatial attention. We therefore propose a simple but extremely effective scene text recognition method based on transformer [50]. Different from previous transformer based models [56,34], which just use the decoder of the transformer to decode the convolutional attention, the proposed method use a convolutional feature maps as word embedding input into transformer. In such a way, our method is able to make full use of the powerful attention mechanism of the transformer. Extensive experimental results show that the proposed method significantly outperforms state-of-the-art methods by a very large margin on both regular and irregular text datasets. On one of the most challenging CUTE dataset whose state-of-the-art prediction accuracy is 89.6%, our method achieves 99.3%, which is a pretty surprising result. We will release our source code and believe that our method will be a new benchmark of scene text recognition with arbitrary shapes.
연구 동기 및 목표
- 임의의 형태, 폰트, 배경을 가진 장면 텍스트를 인식하는 데 도전하는 것.
- 기존 방법에서 발생하는 왜곡과 오류를 유발하는 이미지 정규화의 필요성을 제거하는 것.
- 트랜스포머의 공간 주의 메커니즘이 정규화를 대체할 수 있는지 탐색하는 것.
- 비정규적이고 임의의 형태를 띤 장면 텍스트 인식 분야의 새로운 기준을 설정하는 것.
제안 방법
- 이 방법은 이미지 정규화를 거치지 않고 컨볼루션 특징 맵을 그대로 트랜스포머 인코더의 입력 임bedding으로 사용한다.
- 트랜스포머의 자기주시 메커니즘을 활용하여 비정규적인 텍스트 레이아웃 간의 공간적 관계를 모델링한다.
- 이전 트랜스포머 모델이 시퀀스 생성을 위해 디코더만 사용하는 것과 달리, 이 접근법은 특징 맵 입력을 받는 전체 인코더-디코더 아키텍처를 활용한다.
- 모델은 디코더를 통해 주어진 주목된 특징 표현에 기반해 시퀀스 예측 작업으로 텍스트 인식을 수행한다.
- 기하학적 정규화나 정규화를 수행하지 않음으로써 투시 변형을 피한다.
- 이 방법은 엔드 투 엔드로 훈련 가능하며, 공간적 및 순차적 의존성을 포괄적으로 포착하기 위해 주로 주의 메커니즘에 의존한다.
실험 결과
연구 질문
- RQ1오직 주의 메커니즘만을 사용하여 이미지 정규화 없이도 장면 텍스트 인식을 효과적으로 수행할 수 있는가?
- RQ2원시 특징 맵을 입력으로 사용하는 트랜스포머 기반 모델이 비정규적 텍스트에서 정규화 기반 최고 수준의 기존 방법보다 어떻게 비교되는가?
- RQ3특징 맵 입력을 사용하는 전체 트랜스포머 인코더-디코더 아키텍처가 이전의 주의 기반 접근법보다 성능 향상에 기여하는가?
- RQ4제안된 방법이 높은 정확도로 정규적 및 비정규적 텍스트 레이아웃 모두에 일반화 가능한가?
- RQ5정규화의 부재가 도전적인 벤치마크에서 인식 정확도 향상에 상당한 기여를 하는가?
주요 결과
- 제안된 방법은 CUTE 데이터셋에서 99.3%의 정확도를 달성하여 이전 SoA인 89.6%보다 크게 향상되었다.
- 이 모델은 정규적 및 비정규적 텍스트 인식 벤치마크 양쪽에서 모든 최고 수준의 기존 방법을 크게 앞서 갔다.
- 제거 실험 결과 정규화가 불필요하며, 이를 제거할수록 성능이 향상됨을 확인하였다.
- 다양한 텍스트 형태, 폰트, 배경 변화에 대해 강력한 일반화 능력을 보였다.
- 결과적으로 트랜스포머의 공간 주의 메커니즘이 기하학적 정규화 없이도 고정확도의 장면 텍스트 인식에 충분함을 입증하였다.
- 저자들은 소스 코드를 공개하여 이 방법을 비정규적 형태의 장면 텍스트 인식 분야의 새로운 기준으로 위치지었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.