[논문 리뷰] Text/Graphics Separation for Business Card Images for Mobile Devices
이 논문은 모바일 기기에서 촬영한 명함 이미지에 대해 계산 효율적인 텍스트/그래픽 분리 방법을 제안한다. 배경을 거친 채로 제거하기 위해 강도 분산을 사용한 후, 텍스트와 그래픽을 구분하기 위한 특징 기반 필터링을 수행하여, 0.75MP 이미지에서 98.54%의 정확도를 달성한다. 이는 보통의 데스크톱 시스템에서 처리 시간이 0.17초, 메모리 사용량이 1.1MB에 불과하여 모바일 배포에 적합함을 보여준다.
Separation of the text regions from background texture and graphics is an important step of any optical character recognition sytem for the images containg both texts and graphics. In this paper, we have presented a novel text/graphics separation technique for business card images captured with a cell-phone camera. At first, the background is eliminated at a coarse level based on intensity variance. This makes the foreground components distinct from each other. Then the non-text components are removed using various characteristic features of text and graphics. Finally, the text regions are skew corrected and binarized for further processing. Experimenting with business card images of various resolutions, we have found an optimum performance of 98.54% with 0.75 MP images, that takes 0.17 seconds processing time and 1.1 MB peak memory on a moderately powerful computer (DualCore 1.73 GHz Processor, 1 GB RAM, 1 MB L2 Cache). The developed technique is computationally efficient and consumes low memory so as to be applicable on mobile devices.
연구 동기 및 목표
- 모바일 카메라로 촬영한 명함 이미지에서 텍스트, 그래픽, 배경 무늬를 효과적으로 분리하는 문제를 해결하기 위해.
- 제한된 컴퓨팅 자원을 가진 모바일 기기에서 실시간 처리에 적합한 정확도와 효율성을 동시에 확보하는 방법을 개발하기 위해.
- 복잡한 저해상도 이미지에서 비텍스트 요소를 제거함으로써 광학 문자 인식(OCR) 시스템의 성능을 향상시키기 위해.
- 일반적으로 모바일 촬영 시 발생하는 다양한 해상도와 조명 조건에서도 강인한 성능을 유지를 하기 위해.
제안 방법
- 지역 강도 분산을 활용하여 배경을 거친 채로 제거하여 초기적으로 배경을 제거한다.
- 전경 성분은 종횡비, 스토크 폭, 무늬 패턴 등의 다양한 특징을 분석하여 텍스트 또는 비텍스트(그래픽/배경)로 분류한다.
- 이러한 특징의 통계적 분석을 통해 도출된 사전 정의된 임계값 기반으로 비텍스트 성분을 필터링한다.
- 텍스트 영역는 허프 변환 기반 선 검출을 이용해 기울기 보정하여 OCR 정확도를 향상시킨다.
- 최종 텍스트 영역에 대해 적응형 임계값을 적용하여 이진화를 수행하여 대비를 향상시키고 OCR 처리에 대비한다.
- 전체 파이프라인은 낮은 메모리 및 처리 오버헤드를 고려하여 최적화되어 있어 모바일 플랫폼에의 배포가 가능하다.
실험 결과
연구 질문
- RQ1저복잡도 방법이 모바일 촬영 명함 이미지에서 텍스트, 그래픽, 배경을 효과적으로 분리할 수 있는가?
- RQ2자원 제약 조건 하에서 강도 분산과 특징 기반 필터링의 조합 중 어떤 조합이 최적의 텍스트 영역 탐지 성능을 낼 수 있는가?
- RQ3이 방법은 모바일 카메라에서 흔히 발생하는 다양한 해상도에서 어떻게 성능을 발휘하는가?
- RQ4처리 시간과 메모리 사용량을 최소화하면서도 높은 정확도를 유지하는 데까지 어느 정도의 성능을 보이는가?
주요 결과
- 제안된 방법은 0.75MP 명함 이미지에서 텍스트 탐지 정확도가 98.54%에 도달한다.
- 듀얼코어 1.73GHz 프로세서와 1GB RAM을 탑재한 시스템에서 처리 시간이 단 0.17초로 실시간 모바일 사용에 적합하다.
- 정점 메모리 사용량은 1.1MB로 제한되어 있어 일반적인 모바일 기기의 제약 조건을 충족한다.
- 일반적으로 모바일 촬영 시 발생하는 다양한 해상도와 조명 조건에서도 강인한 성능을 유지도한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.