[논문 리뷰] Text/Graphics Separation and Skew Correction of Text Regions of Business Card Images for Mobile Devices
이 논문은 모바일 기기로 촬영한 명함 이미지에서 텍스트와 그래픽을 분리하고 기울기를 보정하는 계산 효율적인 방법을 제시한다. 배경을 거친 채로 제거하기 위해 강도 분산을 사용한 후, 기하학적 및 구조적 특징(예: 종횡비, 선 폭, 연결성 등)을 기반으로 텍스트 및 비텍스트 영역으로 전경을 분할한다. 이로써 0.75MP 해상도 이미지에서 98.25%의 재현율을 달성했으며, 보통의 데스크톱 시스템에서 처리 시간은 0.17초, 메모리 사용량은 1.1MB로, 이는 모바일 환경에 적합함을 보여준다.
Separation of the text regions from background texture and graphics is an important step of any optical character recognition system for the images containing both texts and graphics. In this paper, we have presented a novel text/graphics separation technique and a method for skew correction of text regions extracted from business card images captured with a cell-phone camera. At first, the background is eliminated at a coarse level based on intensity variance. This makes the foreground components distinct from each other. Then the non-text components are removed using various characteristic features of text and graphics. Finally, the text regions are skew corrected for further processing. Experimenting with business card images of various resolutions, we have found an optimum performance of 98.25% (recall) with 0.75 MP images, that takes 0.17 seconds processing time and 1.1 MB peak memory on a moderately powerful computer (DualCore 1.73 GHz Processor, 1 GB RAM, 1 MB L2 Cache). The developed technique is computationally efficient and consumes low memory so as to be applicable on mobile devices.
연구 동기 및 목표
- 저해상도 모바일 카메라로 촬영한 명함 이미지에서 배경 그래픽과 텍스트 영역을 정확하게 분리하는 데 도전하는 것.
- 제한된 처리 능력을 지닌 모바일 기기에서 구동 가능한 계산 효율적이고 메모리 경량화된 방법을 개발하는 것.
- 추출된 텍스트 영역의 기울기를 보정하여 후속 광학 문자 인식(OCR)의 정확도를 향상시키는 것.
- 모바일로 촬영한 명함에서 흔히 볼 수 있는 다양한 해상도와 품질 수준에서도 뛰어난 성능을 유지를 보장하는 것.
제안 방법
- 전경과 배경 요소 간의 대trast를 향상시키기 위해 局부 강도 분산을 사용하여 초기적으로 거친 배경 억제를 수행한다.
- 기하학적 및 구조적 특징(예: 종횡비, 선 폭, 연결성 등)을 기반으로 전경 요소를 잠재적 텍스트 및 비텍스트 영역으로 분할한다.
- 그래픽에서 특징적인 형태 기술자와 공간 분포 패턴을 조합하여 비텍스트 요소를 필터링한다.
- 수평 및 수직 축을 따라 투영 프로필 분석을 통해 텍스트 영역의 기울기 각도를 분석한다.
- 계산된 각도를 기반으로 텍스트 영역을 기울임을 보정하기 위해 기준선에 맞추어 회전시킨다.
- 모든 파이프라인은 계산 부담과 메모리 소비를 최소화하도록 최적화되어 있어 모바일 플랫폼에서의 구현 가능성을 확보한다.
실험 결과
연구 질문
- RQ1어떻게 하면 모바일 기기로 촬영한 저해상도 명함 이미지에서 텍스트와 그래픽을 효과적으로 분리할 수 있는가?
- RQ2복잡한 배경에서 텍스트와 비텍스트 구성 요소를 신뢰성 있게 구분하는 데에 적합한 이미지 특징 조합은 무엇인가?
- RQ3기울기 보정은 모바일로 촬영한 명함 이미지의 OCR 정확도를 어느 정도 향상시킬 수 있는가?
- RQ4제안된 방법의 계산 및 메모리 오버헤드는 얼마이며, 이는 모바일 하드웨어에서 효율적으로 배포될 수 있는가?
주요 결과
- 이 방법은 0.75MP 해상도의 명함 이미지에서 98.25%의 재현율을 달성하여 텍스트 영역 탐지의 높은 정확도를 보여준다.
- 듀얼코어 1.73GHz 프로세서와 1GB RAM을 장착한 시스템에서 처리 시간이 단 0.17초로, 실시간 성능 가능성을 입증한다.
- 정점 메모리 사용량은 1.1MB로 제한되어 있어 자원이 제한된 모바일 환경에 적합하다.
- 다양한 해상도와 배경 복잡도를 지닌 이미지에 대해서도 효과적으로 대응하며, 매우 높은 강건성을 유지한다.
- 강도 분산 기반 분할과 특징 기반 필터링의 조합은 복잡한 학습 또는 훈련 단계 없이도 정확한 텍스트 추출을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.