Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Neural Network for Semantic-based Text Recognition in Images

Yi Zheng, Qitong Wang|arXiv (Cornell University)|2019. 08. 04.
Handwritten Text Recognition Techniques참고 문헌 31인용 수 5
한 줄 요약

이 논문은 문맥적 이해를 통해 고립된 단어 인식을 넘어서는 의미 기반 텍스트 인식(STR) 모델을 제안한다. 이 모델은 텍스트 그룹화 및 정렬(TGA) 알고리즘을 통해 고립된 텍스트 영역을 그룹화하고 순서를 정함으로써 이미지 내 텍스트 인식을 향상시키고, 양방향 LSTM를 갖춘 순서열 모델을 통해 예측을 보정한다. STR 모델은 스캔된 카탈로그 이미지에서 90%의 정확도를 달성하고, 도전적인 시위 현수막 이미지에서는 71%의 정확도를 기록하여 고립된 단어 인식을 넘어서는 문맥적 이해를 통해 더 뛰어난 내성적 안정성을 확보한다.

ABSTRACT

State-of-the-art text spotting systems typically aim to detect isolated words or word-by-word text in images of natural scenes and ignore the semantic coherence within a region of text. However, when interpreted together, seemingly isolated words may be easier to recognize. On this basis, we propose a novel "semantic-based text recognition" (STR) deep learning model that reads text in images with the help of understanding context. STR consists of several modules. We introduce the Text Grouping and Arranging (TGA) algorithm to connect and order isolated text regions. A text-recognition network interprets isolated words. Benefiting from semantic information, a sequenceto-sequence network model efficiently corrects inaccurate and uncertain phrases produced earlier in the STR pipeline. We present experiments on two new distinct datasets that contain scanned catalog images of interior designs and photographs of protesters with hand-written signs, respectively. Our results show that our STR model outperforms a baseline method that uses state-of-the-art single-wordrecognition techniques on both datasets. STR yields a high accuracy rate of 90% on the catalog images and 71% on the more difficult protest images, suggesting its generality in recognizing text.

연구 동기 및 목표

  • 최신 텍스트 스핑 시스템이 텍스트 영역 내 의미적 일관성을 忽시하는 한계를 해결하기 위해.
  • 그룹화된 어구나 문장으로부터의 맥락적 및 의미적 정보를 활용하여 텍스트 인식 정확도를 향상시키기 위해.
  • 고립된 텍스트 영역을 일관된 어구 또는 문단으로 그룹화하고 순서를 정하는 새로운 레이아웃 분석 알고리즘(TGA)을 개발하기 위해.
  • 학습 및 평가를 위한 다중어절 어구와 문단의 정답 그룹화가 포함된 두 가지 새로운 공개 데이터셋을 구축하기 위해.
  • 의미 기반 텍스트 인식에서 맥락의 일반성과 효과성을 다양한 실제 이미지 도메인에서 입증하기 위해.

제안 방법

  • TGA 알고리즘은 공간적 근접성, 정렬, 시각적 유사성 분석을 통해 고립된 텍스트 영역을 일관된 어구 또는 문단으로 그룹화하고 순서를 정한다.
  • 딥 러닝 기반의 텍스트 인식 네트워크가 개별 단어를 처리하고 초도 예측을 생성한다.
  • 양방향 LSTM를 갖춘 순서열 모델이 예측된 단어 시퀀스로부터 맥락 정보를 인코딩하여 철자 및 단어 선택 오류를 수정한다.
  • 순서열 모델은 예측된 단어 시퀀스를 입력으로 받아 수정된 시퀀스를 출력으로 내보내며, 맥락 기반 철자 오류 수정이 가능하다.
  • 이 모델은 이미지 특징에만 의존하는 것이 아니라, 공간적 그룹화와 의미적 맥락을 포함한 다수 수준의 정보를 통합하여 인식 성능을 향상시킨다.
  • 이 프레임워크는 두 가지 새로운 데이터셋인 IDD(스캔된 인테리어 카탈로그)와 TPID(손글씨 텍스트가 포함된 시위 현수막 사진)에서 학습 및 평가된다.

실험 결과

연구 질문

  • RQ1고립된 텍스트 영역을 일관된 어구로 그룹화하고 순서를 정함으로써 이미지 내 텍스트 인식 정확도를 향상시킬 수 있는가?
  • RQ2양방향 LSTM를 갖춘 순서열 모델이 의미적 맥락을 활용해 단어 인식 오류를 얼마나 효과적으로 수정할 수 있는가?
  • RQ3불규칙한 텍스트 레이아웃을 가진 도전적인 실제 이미지에서 의미적 맥락을 통합함으로써 인식 성능 향상이 실제로 유의미하게 이루어지는가?
  • RQ4프inted 카탈로그와 손글씨 시위 현수막과 같은 다양한 의미적 맥락에서 모델의 일반화 능력은 어느 정도인가?
  • RQ5TGA와 같은 레이아웃 분석 알고리즘이 복잡한 환경에서 같은 어구 또는 문단에 属하는 텍스트 영역을 신뢰성 있게 식별하고 순서를 정할 수 있는가?

주요 결과

  • STR 모델은 스캔된 인테리어 카탈로그 데이터셋(IDD)에서 90%의 인식 정확도를 기록하여 기준 단일 단어 인식 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 더 도전적인 시위 이미지 데이터셋(TPID)에서는 STR가 71%의 정확도를 기록하여 기하학적 왜곡, 비정상적인 폰트, 수평이 아닌 텍스트 레이아웃에 대해서도 뛰어난 내성적 안정성을 입증했다.
  • TGA 알고리즘은 IDD 이미지의 90%에서 텍스트 영역을 성공적으로 그룹화하고 정렬했으며, 단일이고 명확한 글씨의 시위 현수막에서는 신뢰성 있게 작동하지만, 겹치거나 기울인 텍스트 영역에서는 어려움을 겪었다.
  • 순서열 보정 모델은 잘못 인식된 단어(예: 'SILLS' → 'SPILLS')나 누락된 단어(예: 문장에서 'a') 등의 오류를 효과적으로 수정하여 유창성과 정확도를 향상시켰다.
  • 모델은 의미적 맥락을 활용함으로써 오류율을 감소시켜, 고립된 단어 분석을 넘어서 맥락 정보가 인식 성능 향상에 크게 기여한다는 것을 입증했다.
  • 정답 어구 및 문단 주석이 포함된 제안된 데이터셋 IDD와 TPID는 공개되어 있으며, 의미 기반 텍스트 인식을 위한 새로운 벤치마크로 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.