Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarking recognition results on word image datasets

Deepak Kumar, Mohit Prasad|arXiv (Cornell University)|2012. 08. 30.
Handwritten Text Recognition Techniques참고 문헌 14인용 수 5
한 줄 요약

이 논문은 픽셀 수준의 세분화와 상용 OCR(Nuance Omnipage)를 사용하여 단어 이미지 인식에 대한 벤치마크를 제시한다. 각각 ICDAR 2003에서 83.9%, Sign evaluation에서 89.3%, Street View에서 79.6%, Born-digital에서 88.5%, ICDAR 2011에서 86.7%의 인식률을 달성한다. 저자들은 다섯 가지 다양한 데이터셋에 걸쳐 3,606개의 단어 이미지를 수작업으로 픽셀 수준으로 주석 처리하기 위해 GUI 기반 MATLAB 도구를 개발하였으며, 정확한 세분화가 특히 기울어지거나 굽은 형태이거나 열악한 조건의 텍스트에서 OCR 성능을 크게 향상시킨다는 것을 입증하였다.

ABSTRACT

We have benchmarked the maximum obtainable recognition accuracy on various word image datasets using manual segmentation and a currently available commercial OCR. We have developed a Matlab program, with graphical user interface, for semi-automated pixel level segmentation of word images. We discuss the advantages of pixel level annotation. We have covered five databases adding up to over 3600 word images. These word images have been cropped from camera captured scene, born-digital and street view images. We recognize the segmented word image using the trial version of Nuance Omnipage OCR. We also discuss, how the degradations introduced during acquisition or inaccuracies introduced during creation of word images affect the recognition of the word present in the image. Word images for different kinds of degradations and correction for slant and curvy nature of words are also discussed. The word recognition rates obtained on ICDAR 2003, Sign evaluation, Street view, Born-digital and ICDAR 2011 datasets are 83.9%, 89.3%, 79.6%, 88.5% and 86.7% respectively.

연구 동기 및 목표

  • 수작업 픽셀 수준의 세분화와 상용 OCR을 활용한 단어 이미지 인식에 대한 신뢰할 수 있는 벤치마크를 확립하기 위해.
  • 경계 상자 주석의 한계를 보완하기 위해 정교한 픽셀 수준의 레이블링을 도입하여 OCR 정확도를 향상시키기 위해.
  • 흐림, 기울임, 굽힘, 저해상도 등의 영향을 받는 이미지의 열악함이 인식 성능에 미치는 영향을 평가하기 위해.
  • 세분화 및 인식 모델의 훈련과 테스트를 위해 공개 가능한 고품질의 주석 처리된 단어 이미지 데이터셋을 제공하기 위해.
  • 특히 실제 응용 환경에서 어려운 이미지에서 높은 인식 정확도를 달성하기 위해 세분화 품질이 핵심 요소임을 입증하기 위해.

제안 방법

  • 단어 이미지의 반자동 픽셀 수준 세분화를 위한 맞춤형 MATLAB 기반 그래픽 사용자 인터페이스(GUI)를 개발하였다.
  • ICDAR 2003, Sign evaluation, Street View, Born-digital, ICDAR 2011의 다섯 데이터셋에 걸쳐 총 3,606개의 단어 이미지를 수작업으로 주석 처리하였다.
  • 이진화된 단어 이미지에서 문자를 인식하기 위해 Nuance Omnipage Professional 16 OCR의 시범 버전을 사용하였다.
  • 다양한 데이터셋 간의 정확도 비교를 공정하게 하기 위해 편집 거리 측정치에 정규화 기법을 적용하였다.
  • 편집 거리와 단어 수준 정확도를 평가 지표로 사용하여 각 데이터셋 별로 결과를 보고하였다.
  • 수작업 세분화와 사전 처리를 통해 운동 흐림, 기울임, 굽힘, 저해상도 등의 열악한 조건을 다루었다.

실험 결과

연구 질문

  • RQ1상용 OCR를 사용하여 단어 이미지를 픽셀 수준으로 세분화할 경우, 어떤 정도의 인식 정확도를 달성할 수 있는가?
  • RQ2흐림, 기울임, 굽힘, 저해상도 등의 다양한 이미지 열악함이 단어 이미지의 OCR 성능에 어떤 영향을 미치는가?
  • RQ3경계 상자 기반 접근 방식에 비해 픽셀 수준 세분화는 인식 정확도를 얼마나 향상시키는가?
  • RQ4수작업 주석 처리된 픽셀 수준의 데이터셋은 단어 인식 시스템 평가를 위한 신뢰할 수 있는 벤치마크로 활용될 수 있는가?
  • RQ5예를 들어 도시 풍경, 디지털 생성, 스트리트 뷰 등의 다양한 유형의 단어 이미지 데이터셋 간 인식 성능는 어떻게 달라지는가?

주요 결과

  • Sign evaluation 데이터셋에서 가장 높은 인식률 89.3%를 기록하여 깔끔하고 잘 정리된 텍스트에서 뛰어난 성능을 보였다.
  • ICDAR 2011 데이터셋은 86.7%의 인식률을 기록하여 데이터셋 정제로 인해 이전 벤치마크보다 향상된 성능을 보였다.
  • Street View 데이터셋은 79.6%의 인식률을 기록하여 실제 환경 이미지에서 굽힘, 기울임, 흐림 등의 도전 과제가 뚜렷하게 드러났다.
  • Born-digital 데이터셋은 88.5%의 인식률을 기록하여 촬영된 장면보다 이미지 품질이 높고 열악한 조건이 적어 더 나은 성능을 보였다.
  • ICDAR 2003 데이터셋은 83.9%의 인식률을 기록하여 열악한 조건이 존재하더라도 적절한 세분화로 높은 정확도를 달성할 수 있음을 보여주었다.
  • 본 연구는 세분화 품질이 OCR 성공 여부의 주요 결정 요소임을 확인하였으며, 자동화 또는 경계 상자 기반 방법에 비해 수작업 픽셀 수준 주석 처리가 훨씬 우수한 결과를 낳는다는 것을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.