Skip to main content
QUICK REVIEW

[논문 리뷰] Chinese Text in the Wild

Tailing Yuan, Zhe Zhu|arXiv (Cornell University)|2018. 02. 28.
Handwritten Text Recognition Techniques참고 문헌 1인용 수 17
한 줄 요약

이 논문은 32,285장의 스트리트 뷰 이미지에서 100만 개의 레이블이 부여된 중국어 문자를 포함한 대규모 데이터셋인 Chinese Text in the Wild(CTW)을 소개한다. 이 데이터셋은 가림, 낮은 조도, 다양한 글자 스타일 등의 다양한 과제를 수반한다. 최신 기술 기반 모델을 사용하여 인식 작업에서 80.5%의 top-1 정확도(Google Inception 기반)와 검출 작업에서 71.0%의 mAP(YOLOv2 기반)를 달성하여 자연 이미지 내 중국어 텍스트 분야에서 새로운 기준을 설정한다.

ABSTRACT

We introduce Chinese Text in the Wild, a very large dataset of Chinese text in street view images. While optical character recognition (OCR) in document images is well studied and many commercial tools are available, detection and recognition of text in natural images is still a challenging problem, especially for more complicated character sets such as Chinese text. Lack of training data has always been a problem, especially for deep learning methods which require massive training data. In this paper we provide details of a newly created dataset of Chinese text with about 1 million Chinese characters annotated by experts in over 30 thousand street view images. This is a challenging dataset with good diversity. It contains planar text, raised text, text in cities, text in rural areas, text under poor illumination, distant text, partially occluded text, etc. For each character in the dataset, the annotation includes its underlying character, its bounding box, and 6 attributes. The attributes indicate whether it has complex background, whether it is raised, whether it is handwritten or printed, etc. The large size and diversity of this dataset make it suitable for training robust neural networks for various tasks, particularly detection and recognition. We give baseline results using several state-of-the-art networks, including AlexNet, OverFeat, Google Inception and ResNet for character recognition, and YOLOv2 for character detection in images. Overall Google Inception has the best performance on recognition with 80.5% top-1 accuracy, while YOLOv2 achieves an mAP of 71.0% on detection. Dataset, source code and trained models will all be publicly available on the website.

연구 동기 및 목표

  • 자연 이미지 내 중국어 텍스트 인식 및 검출을 위한 대규모이고 다양한 훈련 데이터의 부족 문제를 해결하기 위해.
  • 가림, 조도 변화, 글자 스타일 다양성 등 실제 환경의 복잡성을 반영한 벤치마크 데이터셋을 구축하기 위해.
  • 딥 네트워크를 활용한 문자 인식 및 검출을 위한 최신 기술 기반 기준 모델을 제공하기 위해.
  • 실제 환경 조건에서 강건한 중국어 텍스트 검출 및 인식 기술에 대한 연구를 자극하기 위해.

제안 방법

  • 騰訊 스트리트 뷰에서 32,285장의 스트리트 뷰 이미지를 선별하여 1,018,402개의 중국어 문자 인스턴스를 포함한 레이블링을 수행하였으며, 각 문자에 대해 바운딩 박스와 6개의 속성을 기입하였다.
  • Google Inception, ResNet, AlexNet, OverFeat를 사용하여 문자 인식을 수행하였으며, 입력을 문자 수준의 영역으로 자르는 방식을 적용하였다.
  • 입력 해상도를 조정하고 겹치는 부분이 있는 하위이미지들을 활용한 다중 해상도 추론 전략을 적용하여 YOLOv2를 검출에 적합하게 변형하였다.
  • 다중 하위이미지 입력에서 유도된 검출 결과를 통합하기 위해 비최대 억제(NMS) 기법을 적용하여 국소화 정확도를 향상시켰다.
  • 고해상도 이미지(2048×2048)를 더 작은 겹치는 하위이미지(168×168 및 304×304)로 분할하여 다중 해상도 검출을 수행하였다.
  • 1,001개의 문자 카테고리(희귀 문자를 위한 별도의 '기타' 클래스 포함)로 구성된 데이터셋의 분할된 훈련 및 테스트 세트를 활용하여 학습 및 평가를 수행하였다.

실험 결과

연구 질문

  • RQ1최신 딥 러닝 모델의 성능은 실제 제약 조건이 있는 자연 이미지 내 중국어 텍스트 검출 및 인식에 대해 어떻게 되는가?
  • RQ2가림, 폰트 스타일, 배경 복잡성 등의 다양한 텍스트 속성에 따라 모델 성능은 어떻게 변화하는가?
  • RQ3대규모이고 다양한 특성을 가진 데이터셋은 중국어 텍스트 인식 및 검출 시스템의 강건성 향상에 상당한 기여를 할 수 있는가?
  • RQ4자연 환경에서 작은, 먼, 부분적으로 가려진 중국어 문자를 검출하는 데 있어 핵심 과제는 무엇인가?

주요 결과

  • Google Inception이 CTW 데이터셋에서 80.5%의 최고 top-1 정확도를 기록하여 가장 높은 인식 성능를 보였다.
  • YOLOv2는 복잡한 환경에서도 강력한 일반화 능력을 보이며 문자 검출 작업에서 평균 평균 정확도(mAP) 71.0%를 달성하였다.
  • 검출 성능는 속성에 따라 크게 차이가 났으며, 가려진 문자는 재현율(Recall) 56.7%로 낮았고, 손글씨 문자는 53.8%로 더 낮아 더 높은 과제로 나타났다.
  • 부각된 문자는 평평한 문자보다 약간 높은 재현율(70.1%)을 기록하였으며, 이는 더 강한 구조적 단서 때문으로 보인다.
  • 가장 빈도가 높은 10개의 문자는 AP 점수 80.3%에서 90.3% 사이를 기록하여 일반 문자에 대해 뛰어난 성능를 보였다.
  • 다중 해상도 추론 전략은 작은 문자와 큰 문자의 검출 성능을 향상시켰으며, 크기 범위에 걸쳐 일관된 성능을 보여주는 정밀도-재현율 곡선을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.