[논문 리뷰] ShopSign: a Diverse Scene Text Dataset of Chinese Shop Signs in Street Views
이 논문은 거리 전경에서 촬영한 25,362장의 중국 상점 간판 이미지로 구성된 대규모이고 다양한 종류의 어려운 데이터셋인 ShopSign을 소개한다. 이 데이터셋은 196,010개의 텍스트 라인을 포함하고 있으며, EAST, TextBoxes++, CTPN 등의 최신 스트리트 텍스트 검출기 모델이 ShopSign 및 관련 데이터셋에서 평가되었으며, 특히 거울, 가림, 기형 등의 어려운 케이스에서 훈련할 경우 성능 향상이 뚜렷하게 나타났다.
In this paper, we introduce the ShopSign dataset, which is a newly developed natural scene text dataset of Chinese shop signs in street views. Although a few scene text datasets are already publicly available (e.g. ICDAR2015, COCO-Text), there are few images in these datasets that contain Chinese texts/characters. Hence, we collect and annotate the ShopSign dataset to advance research in Chinese scene text detection and recognition. The new dataset has three distinctive characteristics: (1) large-scale: it contains 25,362 Chinese shop sign images, with a total number of 196,010 text-lines. (2) diversity: the images in ShopSign were captured in different scenes, from downtown to developing regions, using more than 50 different mobile phones. (3) difficulty: the dataset is very sparse and imbalanced. It also includes five categories of hard images (mirror, wooden, deformed, exposed and obscure). To illustrate the challenges in ShopSign, we run baseline experiments using state-of-the-art scene text detection methods (including CTPN, TextBoxes++ and EAST), and cross-dataset validation to compare their corresponding performance on the related datasets such as CTW, RCTW and ICPR 2018 MTWI challenge dataset. The sample images and detailed descriptions of our ShopSign dataset are publicly available at: https://github.com/chongshengzhang/shopsign.
연구 동기 및 목표
- 중국 스트리트 텍스트 검출 및 인식을 위한 대규모이고 다양한 종류의 어려운 데이터셋이 부족한 문제를 해결하기 위해.
- 다양한 도시 및 농촌 환경에서 실제 중국 상점 간판의 대규모 데이터셋을 수집하고 애너테이션 처리하기 위해.
- 거울, 나무, 기형, 노출, 가림 등의 다섯 가지 어려운 이미지 유형을 기반으로 중국 스트리트 텍스트 검출의 어려움을 특성화하고 정량화하기 위해.
- 최신 스트리트 텍스트 검출 모델의 성능을 ShopSign 및 관련 데이터셋에서 평가하여 기존의 한계를 부각시키기 위해.
- 실제이고 어려운 예제를 포함한 벤치마크 데이터셋을 제공함으로써 중국 사진 OCR 분야의 향후 연구를 자극하기 위해.
제안 방법
- 20개 이상의 도시에서 25,362장의 스트리트 뷰 이미지를 수집하였으며, 다양한 모바일 기기(50대 이상)를 사용하여 촬영 조건의 다양성을 확보하였다.
- 텍스트 라인 기반 애너테이션 체계를 사용하여 이미지 내 모든 텍스트 라인을 수동으로 애너테이션 처리하였으며, 각 텍스트 라인에 정확한 바운딩 박스를 확보하였다.
- 시각적 및 인식 도전 과제를 기반으로 이미지를 거울, 나무, 기형, 노출, 가림의 다섯 가지 어려운 카테고리로 분류하였다.
- ShopSign 및 CTW, RCTW, MTWI 데이터셋에서 세 가지 최신 스트리트 텍스트 검출 모델(EAST, TextBoxes++, CTPN)을 훈련하고 평가하였다.
- 어려운 예제에서의 검출 성능을 측정하기 위해 이미지 수준 및 텍스트 라인 수준의 리콜 분석을 수행하였으며, ShopSign 미세조정 여부에 따른 모델 성능을 비교하였다.
- 교차 데이터셋 훈련 및 평가를 통해 일반화 능력과 어려운 케이스(특히 드문 또는 복잡한 텍스트 레이아웃)에서의 성능 향상을 평가하였다.
실험 결과
연구 질문
- RQ1기존의 스트리트 텍스트 검출 모델은 다양한 시각 조건을 가진 실제 중국 상점 간판에 대해 얼마나 잘 일반화되는가?
- RQ2ShopSign 데이터셋을 포함시킬 경우, 거울, 가림, 기형 텍스트와 같은 어려운 예제에서 검출 성능이 얼마나 향상되는가?
- RQ3중국 문자는 스트리트 텍스트 검출에서 어떤 구체적인 과제를 야기하며, 이는 모델의 리콜과 정밀도에 어떤 영향을 미치는가?
- RQ4ShopSign을 훈련 데이터에 포함시킬 경우, CTW 및 RCTW와 같은 벤치마크 데이터셋에서 EAST, TextBoxes++, CTPN 등의 모델 성능은 어떻게 변화하는가?
- RQ5현재의 딥 러닝 모델은 복잡한 실제 환경에서 중국 스트리트 텍스트를 검출할 때 어떤 주요 실패 유형을 보이는가?
주요 결과
- ShopSign는 다양한 지리적 위치와 기기 조건에서 수집된 25,362장의 이미지와 196,010개의 텍스트 라인을 포함하고 있으며, 실제 중국 스트리트 텍스트 데이터셋 중 가장 대규모 중 하나이다.
- EAST, TextBoxes++, CTPN 등의 베이스라인 모델은 ShopSign에서 훈련된 후 어려운 예제에서 리콜 성능이 뚜렷이 향상되었으며, 특히 가림 및 거울 텍스트 케이스에서 두드러진다.
- 어려운 이미지 유형에서 EAST 및 CTPN의 리콜은 거울 및 가림 텍스트에서 41.2% 이하로 떨어져 검출의 어려움을 잘 보여준다.
- TextBoxes++는 EAST 및 CTPN에 비해 어려운 예제에 대해 더 높은 강건성을 보였으며, 특히 거울 및 가림 텍스트에서 두드러진다.
- ShopSign를 사용한 교차 데이터셋 훈련은 CTW, RCTW, MTWI에서 평균 평균 정밀도(mAP)와 리콜 모두 향상시켰으며, 데이터 증강 자원으로서의 가치를 입증하였다.
- 이 데이터셋은 희귀 중국 문자에 대해 심각한 데이터 희소성과 클래스 불균형 문제를 드러내었으며, 향후 연구에서는 GAN 기반의 합성 데이터 생성이 필요하다고 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.