Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Geometric Property Thresholds For Filtering Non-Text Regions In A Connected Component Based Text Detection Application

Teresa Nicole Brooks|arXiv (Cornell University)|2017. 09. 11.
Handwritten Text Recognition Techniques참고 문헌 3인용 수 3
한 줄 요약

이 논문은 MSER와 스트로크 폭 변동성을 사용한 연결 성분 기반 텍스트 검출에서 비텍스트 영역을 걸러내기 위한 기하적 성질 임계값을 조사한다. 수작업으로 조정된 비율, 타원도, 밀도 및 스트로크 폭 변동성의 임계값이 자연적이고 비자연적인 장면에서 모두 텍스트를 효과적으로 탐지함을 보여주며, 비자연적인 이미지에서 더 높은 스트로크 폭 최대 임계값과 감소된 확장량이 개선된 탐지 성능을 이끌어낸다.

ABSTRACT

Automated text detection is a difficult computer vision task. In order to accurately detect and identity text in an image or video, two major problems must be addressed. The primary problem is implementing a robust and reliable method for distinguishing text vs non-text regions in images and videos. Part of the difficulty stems from the almost unlimited combinations of fonts, lighting conditions, distortions, and other variations that can be found in images and videos. This paper explores key properties of two popular and proven methods for implementing text detection; maximum stable external regions (MSER) and stroke width variation.

연구 동기 및 목표

  • 글꼴 스타일과 이미지 특성(예: 블러, 대비, 질감)이 텍스트 검출에서 기하 성질 임계값에 미치는 영향을 평가하는 것.
  • 다양한 이미지 유형에서 비텍스트 영역을 걸러내는 데 가장 효과적인 기하 성질(예: 비율, 타원도, 밀도)을 규명하는 것.
  • 특히 제품 포장과 같은 비자연적인 장면에서 MSER와 스트로크 폭 변동성이 다양한 조건에서 텍스트를 탐지하는 데 얼마나 강건한지 평가하는 것.
  • 비자연적인 이미지에서 매우 스타일화되거나 고유한 폰트를 사용할 경우 탐지 성능을 향상시키기 위한 임계값 튜닝 전략을 특정하는 것.
  • 실세계 텍스트 검출 시스템의 확장성과 강건성을 향상시키기 위해 임계값 선택을 자동화하는 데 기초를 마련하는 것.

제안 방법

  • 그레이스케일 이미지에서 초기 영역 탐지를 위해 최대 안정 외부 영역(MSER)을 사용하였다.
  • 비텍스트 후보를 걸러내기 위해 MSER 영역에서 비율, 타원도, 밀도, 확장도, 유클리드 수를 기하 성질로 추출하였다.
  • 스트로크 폭 변동성 지표를 적용: 스트로크 폭의 표준편차를 평균 스트로크 폭으로 나눈 값으로, 최대 변동성 임계값과 함께 사용하였다.
  • 표준편차 기반 스트레칭을 통한 이미지 대비 강화를 전처리 단계로 구현하였다.
  • 개별 문자 탐지 결과를 단어 또는 줄 단위 후보로 통합하기 위해 경계 상자 확장 및 병합을 구현하였다.
  • 텍스트 인식을 위해 MATLAB의 Tesseract 기반 OCR 엔진을 사용하고, 탐지된 영역의 시각적 점검을 통해 결과를 검증하였다.

실험 결과

연구 질문

  • RQ1자연적이고 비자연적인 장면 이미지에서 다양한 글꼴 스타일이 텍스트 검출에 최적화된 기하 성질 임계값에 어떤 영향을 미치는가?
  • RQ2다양한 이미지 유형에서 비텍스트 영역과 텍스트 영역을 구분하는 데 가장 효과적인 기하 성질(예: 비율, 밀도, 타원도)은 무엇인가?
  • RQ3고대비, 블러, 질감과 같은 이미지 고유의 특성이 신뢰할 수 있는 텍스트 검출을 위해 필요한 임계값에 어떤 영향을 미치는가?
  • RQ4고유하거나 매우 스타일화된 글꼴은 스트로크 폭 변동성과 경계 상자 확장 매개변수 조정이 얼마나 필요로 하는가?
  • RQ5MSER와 스트로크 폭 변동성을 사용한 수작업으로 튜닝된 경량 시스템이 자연적이고 비자연적인 장면에서 모두 강건한 텍스트 검출을 달성할 수 있는가?

주요 결과

  • 기하 임계값을 수작업으로 튜닝한 후, 자연적이고 비자연적인 이미지에서 주요 및 보조 텍스트 영역을 성공적으로 탐지하였다.
  • 비자연적인 이미지에서 모든 문자를 탐지하기 위해 스트로크 폭 변동성 최대 임계값을 자연적인 이미지 대비 두 배로 조정(2배 증가)할 필요가 있었다.
  • 이웃한 경계 상자에 대한 확장량을 감소시킴으로써 비자연적인 이미지에서의 탐지 성능이 향상되었으며, 특히 넓거나 비정규적인 간격을 가진 텍스트에서 두드러졌다.
  • 표준편차 기반 스트레칭을 통해 대비가 추가로 향상된 고대비 이미지는 성능 저하를 보였으며, 이는 임계값 효과를 시사하였다.
  • 스타일화된 글꼴과 고대비의 도전에도 불구하고, MSER와 스트로크 폭 변동성의 조합은 강건했으며, 임계값 민감도에 대한 영향은 최소한이었다.
  • Tesseract 기반 OCR 모듈은 재학습 없이도 표준 영어 텍스트를 성공적으로 인식하였지만, 고유 글꼴의 경우 향후 모델 재학습이 필요로 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.