Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Shape Models: Joint Text Recognition and Segmentation with Very Little Training Data

Xinghua Lou, Ken Kansky|arXiv (Cornell University)|2016. 11. 08.
Handwritten Text Recognition Techniques참고 문헌 18인용 수 6
한 줄 요약

이 논문은 단수백 장의 훈련 이미지만으로도 최신 기술 수준의 스냅샷 텍스트 인식과 정밀한 문자 분할을 달성하는 생성형 형태 모델을 소개한다. 이는 분류 기반 모델에 비해 수개의 수준으로 적은 데이터를 요구한다. 횡방향 제약 조건을 통해 불변성을 인코딩하고, 탐욕적 폰트 선택 방법을 사용함으로써, 모델은 애핀 및 비애핀 변형에 대해 강건하게 일반화되며, 최소한의 지도 학습에도 불구하고 딥 러닝 기반 모델을 능가한다.

ABSTRACT

We demonstrate that a generative model for object shapes can achieve state of the art results on challenging scene text recognition tasks, and with orders of magnitude fewer training images than required for competing discriminative methods. In addition to transcribing text from challenging images, our method performs fine-grained instance segmentation of characters. We show that our model is more robust to both affine transformations and non-affine deformations compared to previous approaches.

연구 동기 및 목표

  • 실제 이미지에서 폰트, 변형, 이미지 품질의 높은 변동성에 기인한 스냅샷 텍스트 인식 문제를 해결하기 위해.
  • 대규모 레이블링 데이터셋에 의존하는 것을 줄이기 위해, 소수의 훈련 예제로부터 잘 일반화되는 생성형 모델을 개발하기 위해.
  • 명시적인 검출 단계 없이도 정확한 문자 분할과 단어 파싱을 동시에 수행하기 위해.
  • 명시적으로 인코딩된 형태 불변성을 통해 애핀 및 비애핀 왜곡에 대한 강건성을 향상시키기 위해.
  • 생성 모델링과 구조화된 사전 지식이 데이터가 부족할 때 딥 러닝 분류 기반 모델을 능가할 수 있음을 보여주기 위해.

제안 방법

  • 깨끗하고 혼잡하지 않은 문자 이미지에서 생성형 형태 모델을 훈련하여, 짧고 긴 횡방향 제약 조건을 사용해 전반적인 형태 구조를 학습한다.
  • 횡방향 제약 조건은 지정된 반경 내에서 제어 가능한 변형을 允허함으로써 변형에 대한 불변성을 인코딩하여 왜곡에 대한 강건성을 향상시킨다.
  • 대규모 데이터베이스에서 대표적인 폰트를 추출하기 위해 탐욕적 폰트 선택 알고리즘을 사용하여 실제 환경에서의 강한 폰트 변동성을 다룬다.
  • 구조화된 출력 학습 기반의 단어 파서는 문자 수준의 특징(예: 크기, 위치, 색상, n-gram)과 언어 모델을 사용하여 단어를 재구성한다.
  • 표준 분류 기반 모델이 전방향 전파만 수행하는 데 반해, 모델은 추론 중에 백트래킹을 수행하여 분할 경계를 정밀하게 개선한다.
  • 파싱 특징에는 형태 사전 지식, 공간 거리, 높이 및 y-오프셋 차이, 색상 유사도, n-gram 확률 등이 포함되며, 모두 정규화되고 로그 변환된다.

실험 결과

연구 질문

  • RQ1생성형 형태 모델이 분류 기반 모델보다 훨씬 적은 훈련 데이터로 스냅샷 텍스트 인식에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2횡방향 제약 조건을 통한 명시적 불변성 인코딩이 애핀 및 비애핀 변형을 다루는 데 얼마나 효과적인가?
  • RQ3생성형 모델이 정확한 분할 경계를 생성하는 능력이 검출 기반 접근 방식에 비해 파싱 성능 향상에 얼마나 기여하는가?
  • RQ4언어 모델을 비활성화했을 때, 시스템의 성능이 CNN과 같은 분류 기반 모델과 비교해 어떻게 되는가?
  • RQ5비계층적 생성형 모델이 직접적으로 모델 구조에 불변성을 인코딩할 경우, 깊이 계층적 분류 기반 모델을 능가할 수 있는가?

주요 결과

  • 모델은 분류 기반 모델이 일반적으로 요구하는 수백만 장의 이미지보다 훨씬 적은 수백 장의 훈련 이미지만으로 ICDAR 2013 및 SVT 데이터셋에서 최신 기술 수준의 성능을 달성했다.
  • 언어 모델을 비활성화했을 때, 시스템의 성능은 약 15% 하락했지만, PhotoOCR의 경우 40% 하락하여 더 나은 분할 성능 덕분에 우수한 강건성을 보였다.
  • 명시적으로 인코딩된 횡방향 제약 조건 덕분에, 애핀 변형과 비애핀 왜곡에 대해 강력한 일반화 능력을 보였다.
  • CNN 및 DPM과 같은 분류 기반 모델과 달리, 생성형 모델은 추가 후처리 없이도 정확한 분할 경계를 생성한다.
  • PhotoOCR가 종종 실패하는 청소년 이미지에서 시스템은 PhotoOCR를 능가했으며, 정밀한 분할의 이점이 뚜렷했다.
  • 구조화된 사전 지식과 불변성 인코딩을 갖춘 생성형 접근 방식은 데이터가 부족한 환경에서 딥 러닝 분류 기반 모델을 능가했으며, 인덕티브 바이어스가 데이터 규모를 초월할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.