Skip to main content
QUICK REVIEW

[논문 리뷰] Hamming OCR: A Locality Sensitive Hashing Neural Network for Scene Text Recognition

Bingcong Li, Xin Tang|arXiv (Cornell University)|2020. 09. 23.
Advanced Image and Video Retrieval Techniques참고 문헌 36인용 수 6
한 줄 요약

Hamming OCR는 전통적인 소프트맥스 및 임베딩 레이어를 국소성 감지 해시(LSH) 기반 해밍 분류기와 해밍 임베딩으로 대체함으로써 어휘 크기와 무관하게 모델 크기를 줄이는 경량의 시나리오 텍스트 인식 모델을 제안한다. 분류 및 표현에 LSH 코드를 사용함으로써 표준 벤치마크와 대규모 중국어 데이터셋(GBK21K)에서 경쟁 가능한 정확도를 달성하며, 분류기의 크기는 단지 1.22MB에 불과하여 표준 소프트맥스 대비 32배 감소하였다.

ABSTRACT

Recently, inspired by Transformer, self-attention-based scene text recognition approaches have achieved outstanding performance. However, we find that the size of model expands rapidly with the lexicon increasing. Specifically, the number of parameters for softmax classification layer and output embedding layer are proportional to the vocabulary size. It hinders the development of a lightweight text recognition model especially applied for Chinese and multiple languages. Thus, we propose a lightweight scene text recognition model named Hamming OCR. In this model, a novel Hamming classifier, which adopts locality sensitive hashing (LSH) algorithm to encode each character, is proposed to replace the softmax regression and the generated LSH code is directly employed to replace the output embedding. We also present a simplified transformer decoder to reduce the number of parameters by removing the feed-forward network and using cross-layer parameter sharing technique. Compared with traditional methods, the number of parameters in both classification and embedding layers is independent on the size of vocabulary, which significantly reduces the storage requirement without loss of accuracy. Experimental results on several datasets, including four public benchmaks and a Chinese text dataset synthesized by SynthText with more than 20,000 characters, shows that Hamming OCR achieves competitive results.

연구 동기 및 목표

  • 대부분의 어휘 크기가 큰 중국어나 다국어 텍스트와 같은 경우에, 시나리오 텍스트 인식 모델에서 소프트맥스 및 임베딩 레이어의 높은 저장 비용을 해결하기 위해.
  • 대규모 어휘 사전 환경에서 정확도를 저하시키지 않은 채 모델 파라미터와 저장 요구량을 줄이기 위해.
  • 피드포워드 네트워크를 제거하고 층 간 파라미터 공유를 적용함으로써 경량화된 트랜스포머 디코더를 설계하기 위해.
  • LSH 코드를 분류기 출력과 문자 임베딩으로 동시에 사용하여 효율적이고 확장 가능한 텍스트 인식을 가능하게 하기 위해.

제안 방법

  • 표준 소프트맥스 레이어를 대체하기 위해 각 문자를 해밍 공간 내의 이진 코드로 매핑하는 LSH 기반 해밍 분류기를 제안한다.
  • 선형 투영과 임계값 처리를 통해 LSH 코드를 생성하며, 코드 표현의 안정성을 높이기 위해 다수결 투표 메커니즘을 적용한다.
  • LSH 코드를 직접 출력 임베딩으로 사용함으로써 별도의 임베딩 매트릭스가 필요 없어지며, 파라미터 수가 감소한다.
  • 피드포워드 네트워크를 제거하고 층 간 파라미터 공유를 적용함으로써 파라미터를 줄인 단순화된 트랜스포머 디코더를 도입한다.
  • 모바일 기기에서의 효율적 구현을 위해 MobileNetV2를 특징 인코더로 활용한다.
  • LSH 투영 매트릭스의 정확한 분류를 최적화하기 위해 허프 레이어를 사용하여 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1LSH 기반 해밍 코드가 정확도를 유지하면서도 전통적인 소프트맥스 및 임베딩 레이어를 효과적으로 대체할 수 있는가?
  • RQ2대규모 어휘 환경, 예를 들어 중국어 텍스트 인식에서 LSH 코드의 성능은 무작위 이진 코드보다 어떻게 비교되는가?
  • RQ3시나리오 텍스트 인식에서 모델 성능와 크기의 균형을 고려할 때 LSH 코드의 최적 길이는 무엇인가?
  • RQ4밀도 매트릭스 대신 LSH 코드를 사용함으로써 분류기 및 임베딩 레이어의 파라미터 감소는 어느 정도 가능할 수 있는가?
  • RQ5공유된 파라미터와 함께 피드포워드 네트워크를 제거한 단순화된 트랜스포머 디코더는 정확도 유지에 얼마나 효과적인가?

주요 결과

  • Hamming OCR 모델은 20,000자 이상의 문자를 포함하는 GBK21K 데이터셋에서 82.41%의 정확도를 달성하였으며, 수렴하지 못한 무작위 이진 코드보다 뚜렷하게 뛰어난 성능을 보였다.
  • LSH 기반 분류기는 단지 1.22MB의 저장 공간만을 필요로 하여, 512차원 특징 공간과 20,000개 클래스 어휘 크기를 가진 표준 소프트맥스 레이어의 39.1MB 대비 32배 감소하였다.
  • 512비트 LSH 코드를 사용한 모델이 GBK21K에서 최고의 성능을 보였으며, 정확도는 82.39%였고, 512비트를 초과하면 성능이 포화 상태에 이르렀다.
  • 무작위 이진 코드는 SVT에서 84.54%의 정확도를 기록했지만, GBK21K에서는 완전히 수렴하지 못했으며, 이는 대규모 어휘에서 구조화된 LSH 코드의 필수성을 입증한다.
  • 층 간 파라미터 공유를 적용하고 피드포워드 네트워크를 제거한 단순화된 트랜스포머 디코더는 모델 파라미터를 줄이면서도 경쟁 가능한 성능을 유지하였다.
  • Hamming OCR 모델은 네 개의 공개 벤치마크와 대규모 중국어 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 이는 대규모 어휘 텍스트 인식에서의 효과성과 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.